Aller au contenu principal
Learning à localiser des trajectoires de référence dans l'espace image pour la navigation visuelle
RecherchearXiv cs.RO 

Learning à localiser des trajectoires de référence dans l'espace image pour la navigation visuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté LoTIS, un nouveau modèle de navigation visuelle pour robots capable de localiser une trajectoire de référence directement dans l'image captée par la caméra du robot, sans calibration caméra, sans données de pose et sans entraînement spécifique à chaque plateforme robotique. Plutôt que de prédire des actions liées à un robot particulier, le système prédit où les points de la trajectoire de référence apparaîtraient dans le champ de vision actuel du robot, ce qui rend le guidage transférable d'une plateforme à l'autre sans réentraînement (zero-shot). Sur des tâches de navigation classique en avant, LoTIS dépasse les méthodes de référence de 20 à 50 points de pourcentage en taux de réussite, atteignant 94 à 98% de succès sur des environnements variés, simulés comme réels. Sur des tâches plus difficiles où les approches existantes échouent, comme la marche arrière, le gain dépasse un facteur cinq. Les auteurs montrent aussi qu'une simple vidéo filmée avec un téléphone suffit à guider différents robots vers n'importe quel point de la trajectoire enregistrée. Code, démonstration et vidéos sont disponibles sur le site des auteurs.

Cette avancée s'attaque directement à l'un des points de friction majeurs de la robotique mobile actuelle: la dépendance des systèmes de navigation visuelle à des données spécifiques au robot (calibration caméra, poses précises, entraînement par plateforme), qui limite fortement leur portabilité industrielle. En découplant la perception (localiser où aller dans l'image) de l'action (comment s'y déplacer physiquement), LoTIS ouvre la voie à des workflows où une trajectoire filmée une seule fois, même avec un smartphone, pourrait piloter une flotte hétérogène de robots ou d'AMR sans travail d'intégration lourd par modèle.

Ce travail s'inscrit dans une lignée de recherche en navigation par imitation visuelle qui cherchait jusqu'ici à imiter des comportements complets plutôt qu'à simplement localiser une cible dans l'image, une approche jugée plus fragile aux changements de point de vue ou de caméra. La stratégie d'entraînement croisé entre trajectoires proposée par les auteurs vise justement à corriger cette fragilité. Le papier, publié sur arXiv, reste à ce stade une contribution académique; son adoption par des intégrateurs ou fabricants de robots commerciaux reste à démontrer.

Dans nos dossiers

À lire aussi

VLM-MPPI : ancrer le langage naturel dans des trajectoires diversifiées pour la navigation aérienne
1arXiv cs.RO 

VLM-MPPI : ancrer le langage naturel dans des trajectoires diversifiées pour la navigation aérienne

Un système hiérarchique de navigation pour drones, baptisé VLM-MPPI, traduit une consigne en langage naturel en trajectoires de vol réalistes dans des environnements intérieurs encombrés. Son cœur repose sur un ensemble parallélisé de six planificateurs MPPI (Model Predictive Path Integral) conditionnés par comportement, chacun doté de coûts de guidage et de biais d'échantillonnage spécifiques qui produisent six modes de trajectoire distincts plutôt que de simples variations aléatoires autour d'une même solution. Ces trajectoires 3D sont projetées sur le flux vidéo RGB embarqué en vue subjective, ce qui transforme l'ancrage du langage en un problème de sélection visuelle : un modèle vision-langage préentraîné choisit, de façon asynchrone, l'indice du candidat correspondant le mieux à la consigne textuelle et à l'image annotée. Pendant ce temps, les planificateurs MPPI replanifient à 20 Hz et un contrôleur bas niveau de type PID suit la trajectoire retenue. L'ensemble a été testé dans le simulateur NVIDIA Isaac Sim et sur un quadricoptère réel équipé de LiDAR et de caméra RGB, avec un taux de réussite de 100% rapporté sur les scénarios évalués. L'intérêt principal tient à la façon dont l'architecture contourne la latence d'inférence des modèles vision-langage, un frein connu pour le contrôle de vol en temps réel où le drone doit réagir en quelques dizaines de millisecondes. En confiant la sélection sémantique, plus lente, au VLM et la planification dynamique, plus rapide, à MPPI, le système garde un ancrage du langage robuste sans sacrifier la réactivité ni la sécurité du vol. Pour les équipes travaillant sur les architectures vision-langage-action comme Pi-0 ou GR00T N2, pensées surtout pour la manipulation ou la locomotion au sol, cette approche propose une alternative : plutôt que de faire prédire des actions continues au modèle, on le limite à choisir parmi un petit ensemble de trajectoires déjà validées comme dynamiquement faisables. Le taux de succès de 100% doit toutefois être relativisé, puisqu'il porte sur des scénarios évalués par les auteurs eux-mêmes, dans un cadre encore expérimental et limité en diversité d'environnements. Le travail s'inscrit dans la continuité de MPPI, technique de commande prédictive par échantillonnage déjà répandue en robotique mobile, ici étendue pour intégrer un objectif sémantique porté par un modèle de fondation, et dans la vague plus large des architectures vision-langage-action déjà explorées ailleurs pour la manipulation ou les robots humanoïdes comme Helix. Publié en preprint sur arXiv (2609.18451), sans révision par les pairs à ce stade et sans partenaire industriel ni acteur français ou européen mentionné, il s'agit d'un résultat de recherche démontrant la faisabilité du concept sur un seul quadricoptère plutôt que d'un produit prêt à déployer, sans calendrier annoncé pour des essais à plus grande échelle.

RecherchePaper
1 source
SE(2) : un maillage de navigation pour la planification de trajectoires
2arXiv cs.RO 

SE(2) : un maillage de navigation pour la planification de trajectoires

Des chercheurs proposent le SE(2) Navigation Mesh (SE(2) NavMesh), une nouvelle représentation cartographique pour la navigation globale des robots terrestres dans des environnements complexes à plusieurs niveaux, comme les bâtiments multi-étages ou les entrepôts encombrés. Publiée sur arXiv sous la référence 2607.01454v1, l'étude part d'un constat: les nuages de points et les cartes d'occupation volumétrique manquent de structure de surface explicite pour estimer la franchissabilité du terrain, tandis que la recherche de chemin directe sur des maillages triangulaires denses reste trop coûteuse en calcul. Les navmesh classiques, qui découpent l'espace en polygones traversables, supposent que la franchissabilité ne dépend pas de l'orientation du robot, ce qui les rend inadaptés aux robots non circulaires évoluant dans des espaces contraints. Le SE(2) NavMesh corrige ce défaut en évaluant la franchissabilité via des masques d'empreinte au sol et en construisant un graphe organisé en couches spécifiques à chaque orientation, avec une connectivité translationnelle et rotationnelle explicite. Les auteurs introduisent aussi une stratégie de recherche de chemin en deux temps, baptisée A-String Pulling-A (ASA), qui optimise hiérarchiquement la position puis le cap du robot, ainsi qu'une méthode en ligne mettant à jour incrémentalement le NavMesh à partir de flux de nuages de points pendant la reconstruction géométrique de l'environnement. En simulation, le SE(2) NavMesh capture plus de 50% de surface traversable en plus qu'un navmesh classique, et le pipeline SE(2) NavMesh + ASA surpasse systématiquement les méthodes d'échantillonnage de référence dans les espaces confinés. Des expériences réelles sur robot physique confirment la génération en temps réel et une navigation réussie dans plusieurs environnements. Cette avancée cible un angle mort persistant de la navigation robotique: la plupart des pipelines actuels traitent le robot comme un disque, une approximation valable pour des AMR circulaires mais qui échoue dès qu'un châssis allongé, asymétrique ou muni d'un bras déployé doit se faufiler entre des obstacles serrés. Pour les intégrateurs qui déploient des robots logistiques ou des plateformes mobiles à bras manipulateur dans des entrepôts, usines ou bâtiments à plusieurs niveaux, cette limite se traduit par des chemins sous-optimaux, des blocages évitables ou des marges de sécurité excessives qui réduisent l'espace exploitable. En démontrant qu'une représentation sensible à l'orientation peut être calculée et mise à jour en temps réel, y compris pendant la reconstruction de la carte, les auteurs répondent à une objection fréquente: que ce type d'approche serait trop coûteux pour tourner en embarqué. Le gain de plus de 50% en surface traversable exploitable n'est pas un détail marginal, il implique potentiellement moins de détours et une meilleure utilisation de l'espace dans des contextes où chaque mètre carré compte, comme les micro-fulfillment centers ou les couloirs étroits d'établissements de santé. Le travail s'inscrit dans la lignée des recherches sur la planification de trajectoire pour robots terrestres, longtemps tiraillées entre deux extrêmes: les cartes d'occupation, simples à construire mais pauvres en information de franchissabilité, et les maillages triangulaires denses, riches en détail mais trop lourds pour une recherche de chemin en temps réel. Les navmesh polygonaux classiques, utilisés de longue date dans le jeu vidéo puis adoptés par la robotique mobile, avaient déjà réglé le problème du coût de calcul, mais au prix de l'hypothèse simplificatrice d'une franchissabilité indépendante de l'orientation. Le SE(2) NavMesh se positionne comme une extension directe de cette famille de méthodes, en ajoutant la dimension manquante sans revenir à la complexité des maillages denses. Les auteurs valident leur approche à la fois en simulation et sur un robot physique réel, ce qui traduit une volonté de rapprocher rapidement cette technique du terrain plutôt que de la cantonner au stade théorique. Les suites attendues pour ce type de travaux incluent généralement l'intégration dans des piles logicielles de navigation existantes et des tests à plus grande échelle sur des flottes hétérogènes.

RecherchePaper
1 source
Transformeur de navigation visuelle à attention de pose
3arXiv cs.RO 

Transformeur de navigation visuelle à attention de pose

Une équipe de recherche a publié le 21 septembre 2026 sur arXiv, sous la référence 2609.21212, VNT-PA (Visual Navigation Transformer with Pose Attention), un planificateur de navigation robotique dont le contexte visuel, un ensemble d'images de profondeur, est indexé par la pose de la caméra plutôt que par l'ordre temporel des observations: l'attention du transformeur dépend ainsi des écarts de position entre les prises de vue, pas de leur chronologie. Entraîné par imitation d'un planificateur de plus court chemin calculé sur le maillage exact de la scène, il prédit ses actions à partir de sa seule pose courante et de la position de l'objectif. Sur la navigation vers un point cible dans les scènes de validation du jeu de données HM3D, VNT-PA atteint 93,3% de réussite et un score SPL, la réussite pondérée par la longueur du trajet, de 90,4%, devançant les modèles qui codent le même contexte en séquence temporelle ou traitent la pose comme une simple donnée d'entrée, aussi bien en performance qu'en efficacité d'entraînement. Cette méthode répond à une limite connue des politiques de navigation apprises: leur difficulté à réutiliser l'expérience de traversées antérieures d'un même lieu sans construire une carte ou un graphe topologique explicite, coûteux à maintenir et sensible au bruit. En indexant le contexte par pose plutôt que par le temps, VNT-PA permet de fusionner au moment du test des images issues de trajectoires différentes, et se dégrade plus progressivement qu'un planificateur appuyé sur une carte explicite lorsque la localisation devient bruitée, un point sensible pour tout déploiement réel où l'odométrie n'est jamais parfaite. Pour les concepteurs de robots mobiles et d'AMR, le résultat suggère qu'un historique d'observations horodaté par la pose peut servir directement de représentation d'environnement, sans module de cartographie dédié, tout en accélérant l'entraînement sur des horizons de navigation longs. Ces travaux prolongent deux familles de méthodes de navigation visuelle par apprentissage: les transformeurs à encodage temporel, peu aptes à réutiliser l'expérience passée, et les systèmes à carte ou graphe topologique explicite, plus robustes à la réutilisation mais coûteux à construire. VNT-PA se compare directement aux deux approches sur le même protocole HM3D, y compris à une variante où la pose est simplement ajoutée comme caractéristique d'entrée plutôt qu'utilisée comme encodage positionnel de l'attention, ce qui isole précisément l'apport de la méthode. Publié comme préprint sur arXiv, le travail reste à ce stade une contribution validée en simulation, sans portage annoncé vers un robot physique ni partenariat industriel.

RecherchePaper
1 source
Correspondance par pont de Schrödinger rectifié pour la navigation visuelle en peu d'étapes
4arXiv cs.RO 

Correspondance par pont de Schrödinger rectifié pour la navigation visuelle en peu d'étapes

Une équipe de chercheurs a soumis sur arXiv (ref. 2604.05673, v2, avril 2026) un cadre baptisé Rectified Schrödinger Bridge Matching (RSBM), visant à réduire drastiquement le coût d'inférence des politiques génératives de navigation visuelle. Les modèles basés sur la diffusion ou les ponts de Schrödinger (SB) capturent fidèlement les distributions d'actions multimodales mais exigent dix étapes d'intégration ou plus, incompatibles avec le contrôle robotique temps-réel. RSBM unifie les SB standard (ε=1, entropie maximale) et le transport optimal déterministe (ε→0, comme en Conditional Flow Matching) via un unique paramètre de régularisation entropique ε. Les auteurs démontrent que le champ de vitesse conditionnel conserve la même forme fonctionnelle sur tout le spectre ε (un seul réseau suffit pour toutes les intensités de régularisation) et que réduire ε diminue linéairement la variance du champ, stabilisant l'intégration ODE à pas larges. Résultat : 94 % de similarité cosinus et 92 % de taux de réussite en 3 étapes seulement, sans distillation ni entraînement multi-étapes. Ce résultat s'attaque directement au goulot d'étranglement des politiques VLA (Vision-Language-Action) en déploiement industriel. Les architectures de diffusion embarquées dans les robots manipulateurs et humanoïdes actuels (π0 de Physical Intelligence, GR00T N2 de NVIDIA) plafonnent leur fréquence de contrôle à cause du nombre d'étapes de dénoising requises. Passer de dix à trois étapes sans distillation, technique qui ajoute un cycle d'entraînement coûteux et instable, ouvre la voie à des politiques embarquables sur matériel edge standard sans GPU serveur dédié. Limite à noter : les expériences portent sur des benchmarks de navigation visuelle simulés ; le transfert sim-to-real n'est pas validé dans cette publication. RSBM s'inscrit dans la continuité de travaux sur l'accélération du sampling génératif : Rectified Flow (Liu et al., 2022), Consistency Models, et l'application des ponts de Schrödinger au contrôle robotique étudiée par des groupes à Stanford et CMU. Face au Conditional Flow Matching de Meta AI, rapide mais moins expressif face aux distributions fortement multimodales, RSBM revendique un équilibre théoriquement fondé entre vitesse et couverture multimodale. Aucune implémentation open-source ni déploiement hardware n'est annoncé à ce stade. Les suites probables incluent une validation sur tâches de manipulation réelles et une comparaison directe avec des méthodes de distillation rapide comme le Shortcut Model de Physical Intelligence.

RechercheOpinion
1 source