Aller au contenu principal
Transfert simulation-réel de la navigation vision-langage en environnements continus avec un robot mobile à direction Ackermann
RecherchearXiv cs.RO 

Transfert simulation-réel de la navigation vision-langage en environnements continus avec un robot mobile à direction Ackermann

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.07192) une étude de transfert simulation-réel pour la navigation guidée par le langage (Vision-Language Navigation, VLN) en environnement continu, testée sur un robot de conception artisanale à direction Ackermann, c'est-à-dire de type voiture, équipé d'une caméra et d'un LiDAR. Le système repose sur une architecture à attention croisée (Cross-Modal Attention, CMA). Celle-ci aligne images et instructions textuelles dans un espace d'embedding commun. Elle a d'abord été entraînée sur un jeu de données existant en simulation, puis affinée avec des données réelles collectées sur le robot. Deux leviers suffisent à l'adaptation : des ajustements photométriques linéaires et un fine-tuning sur un nombre limité d'épisodes. L'ensemble tourne hors ligne sur du matériel dédié embarqué, sans connexion à un service distant. Les performances sont mesurées par le SPL (Success weighted by Path Length) et le nDTW (Normalized Dynamic Time Warping). Le résumé publié ne fournit toutefois aucune valeur chiffrée, ni la taille du jeu de données réel, ni le nombre d'épisodes, ni les références comparées.

L'intérêt tient à la contrainte levée. La plupart des modèles VLN académiques supposent un graphe de navigation prédéfini, des vues panoramiques à 360 degrés et une localisation parfaite. Ces hypothèses sont rarement réunies sur un robot de production. Faire fonctionner un modèle sans graphe, avec une seule caméra frontale, rapproche donc la VLN d'un cas d'usage déployable : donner un ordre en langage naturel à un AMR ou à un véhicule autonome dans un site non cartographié. Pour un intégrateur, le résultat suggère qu'un écart sim-to-real se réduit avec peu de données réelles et un recalage d'image simple, sans pipeline lourd. Il faut cependant rester prudent. Il s'agit d'un prototype de laboratoire, évalué sur un seul robot, et le résumé ne donne ni taux de réussite ni comparaison avec des VLA récents. Les conditions d'essai (lieux, éclairage, obstacles dynamiques) restent inconnues. On ne peut donc pas parler de transfert « résolu ».

Ce travail s'inscrit dans la lignée des benchmarks VLN en simulation, notamment ceux en environnement continu, longtemps éloignés des contraintes matérielles réelles. Il se distingue des grands modèles vision-langage-action (Pi-0, GR00T, Helix) qui visent la manipulation et exigent des ressources de calcul bien supérieures. Ici, l'approche est plus modeste : un modèle CMA léger, exécutable embarqué. Aucune entreprise ni pilote commercial n'est annoncé, et aucun acteur européen n'est cité dans le résumé. La suite logique serait de publier des chiffres comparatifs, de tester d'autres plateformes (robots à roues différentielles, quadrupèdes) et de confronter l'approche à des environnements plus variés. Aucune date de code ou de jeu de données ouvert n'est précisée.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus
1arXiv cs.RO 

GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus

Des chercheurs ont évalué GPT-6-Astra comme agent de navigation dans un système zero-shot de Vision-and-Language Navigation en environnements continus (VLN-CE), où le modèle interprète des instructions en langage naturel, observe son environnement et propose des actions de déplacement. Le système s'appuie sur un cycle observation-décision-exécution avec des appels directs à l'API du modèle, sans harnais d'agent package ni fine-tuning spécifique à la navigation : chaque requête reçoit un sous-ensemble d'observations visuelles, un retour d'exécution des actions précédentes et un historique de progression conservé. L'étude, publiée sur arXiv (2609.20116), porte sur 50 des 100 épisodes val-unseen du benchmark R2R-CE utilisés par le système de référence Open-Nav. Résultats obtenus : taux de réussite de 52,0 %, SPL (Success weighted by Path Length) de 48,9 % et nDTW (normalized Dynamic Time Warping) de 70,8 %. À l'arrêt, 36,0 % des épisodes réussissent via un signal STOP validé par le workflow, et 16,0 % supplémentaires atteignent seulement le critère de distance, à la limite du nombre de pas autorisés. Cette évaluation illustre à la fois le potentiel et les limites d'un grand modèle multimodal utilisé tel quel comme agent de navigation, sans entraînement dédié à la tâche. L'analyse des réponses montre que le modèle relie correctement repères visuels et actions passées aux instructions fournies, et qu'il sait demander des vues supplémentaires ou revenir sur un jugement incertain, un comportement de raisonnement explicite rarement documenté avec ce niveau de détail. Mais l'écart mis en évidence entre compréhension locale et achèvement autonome de la tâche, par exemple un franchissement reconnu comme inachevé alors que le modèle continue de pivoter sur lui-même, pointe une faiblesse structurelle : savoir qu'une action est correcte ne suffit pas à produire un comportement cohérent jusqu'à l'arrêt. Pour les intégrateurs qui envisagent des LLM généralistes pour piloter des robots mobiles ou des AMR, ce résultat tempère l'idée que les modèles zero-shot actuels suffisent en production, d'autant que l'échantillon reste limité à 50 épisodes. Le protocole reprend le sous-ensemble d'épisodes de validation R2R-CE (Room-to-Room en environnements continus) déjà utilisé par Open-Nav, système de navigation antérieur servant de point de comparaison implicite. L'approche se distingue des architectures VLA spécialisées, entraînées de bout en bout sur des données de navigation, en testant directement les capacités générales d'un modèle multimodal via son API, sans fine-tuning ni harnais logiciel dédié. Les auteurs présentent ce travail comme une analyse comportementale plutôt qu'une revendication de performance record, en documentant précisément où le raisonnement du modèle réussit et où il échoue à se traduire en actions physiques cohérentes jusqu'à l'arrêt. Aucun déploiement réel ni produit commercial n'est annoncé : il s'agit d'une évaluation de recherche en preprint, dont les résultats invitent à des travaux futurs sur le contrôle de la terminaison des épisodes et sur l'articulation entre jugement local et planification de trajectoire à plus long terme.

RechercheActu
1 source
SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu
2arXiv cs.RO 

SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu

Des chercheurs ont publié le 11 août 2026 sur arXiv (référence 2608.07548v1) un article présentant SC²-WM, un modèle du monde auto-correcteur destiné à la navigation par vision et langage en environnement continu (VLN-CE), une tâche où un agent robotique doit suivre des instructions en langage naturel pour se déplacer dans un espace qu'il ne perçoit que partiellement. Contrairement à la plupart des méthodes existantes, qui fonctionnent en boucle ouverte sans mécanisme pour détecter une dérive de leur représentation interne pendant l'exécution, SC²-WM introduit une boucle de rétroaction fermée : le modèle du monde anticipe les conséquences d'une action avant de l'exécuter et affine le plan de navigation au niveau de l'état interne. Pour les cas les plus difficiles, les auteurs ajoutent un mécanisme d'adaptation conditionnelle qui met à jour le modèle du monde lui-même au moment du test, lorsque la rétroaction signale que ses capacités sont insuffisantes pour la situation rencontrée. Les expériences, menées sur les benchmarks standards de VLN-CE, montrent une robustesse et une généralisation améliorées par rapport aux approches en boucle ouverte. Le code est mis à disposition sur GitHub (sunrise-ikun/SC2_WM). Aucun chiffre précis de gain de performance ni comparaison avec des systèmes commerciaux n'est communiqué dans le résumé. Cette contribution touche un point sensible de la navigation robotique par instructions : le fossé entre les démonstrations en simulation et la fiabilité en conditions réelles. Un agent en boucle ouverte accumule des erreurs de perception ou d'interprétation du langage sans pouvoir les corriger, ce qui dégrade rapidement ses performances dès que l'environnement s'écarte des données d'entraînement. En donnant au modèle du monde la capacité de vérifier ses propres prédictions avant d'agir, puis de se réadapter localement quand ses connaissances ne suffisent plus, SC²-WM s'inscrit dans une tendance de fond de la recherche en IA incarnée : rendre les architectures de type modèle du monde ou VLA plus robustes à l'inférence, sans réentraînement complet. Pour les intégrateurs travaillant sur des AMR ou des plateformes mobiles guidées par langage naturel, ce type de mécanisme de correction interne est un prérequis pour sortir des scénarios de laboratoire scriptés et s'approcher d'un déploiement fiable en environnement non structuré. SC²-WM s'inscrit dans la lignée des travaux récents combinant modèles du monde et navigation instruite par le langage, un domaine où la littérature s'est jusqu'ici surtout concentrée sur l'amélioration de la perception et de la planification en boucle ouverte, laissant de côté la correction d'erreurs pendant l'exécution. L'article ne précise ni affiliation institutionnelle ni partenariat industriel ; il s'agit d'une publication de recherche accompagnée d'un code open source, sans annonce de produit ni de déploiement commercial. Les prochaines étapes attendues pour ce type de travaux sont généralement une validation sur des plateformes robotiques physiques et une comparaison directe avec d'autres architectures de navigation par le langage, notamment les approches fondées sur des modèles VLA génériques.

RecherchePaper
1 source
TANGO : navigation humanoïde en environnements encombrés grâce à un modèle vision-langage-action (VLA) du corps entier
3arXiv cs.RO 

TANGO : navigation humanoïde en environnements encombrés grâce à un modèle vision-langage-action (VLA) du corps entier

Des chercheurs ont publié sur arXiv (identifiant 2609.09158, deuxième version) TANGO, un modèle vision-langage-action (VLA) qui permet à un robot humanoïde de traverser des environnements intérieurs encombrés à partir d'une consigne en langage naturel. Le système prend en entrée la consigne et des images RGB égocentriques, puis prédit directement des actions articulaires pour 29 DOF, transmises à un contrôleur du corps entier. L'entraînement s'est fait uniquement en simulation. Un pipeline génère des comportements de traversée sans collision: planification de trajectoire globale, génération cinématique de mouvements du corps entier, édition de mouvements tenant compte des obstacles, puis suivi par apprentissage par renforcement, qui garantit la faisabilité dynamique des actions servant de supervision. Selon les auteurs, TANGO atteint l'état de l'art en navigation vision-langage en simulation et dépasse des bases modulaires solides sur les scènes exigeant de négocier des obstacles. Le modèle a ensuite été déployé en zero-shot sur un Unitree G1, sans aucune donnée de navigation réelle, avec une traversée guidée par le langage jugée robuste dans des scènes encombrées réelles. L'intérêt tient au changement de paradigme. La navigation y est traitée comme un problème 3D de coordination du corps entier (placement des bras, ajustement du buste, modulation de la démarche), et non comme une planification 2D de type AMR, où le robot se réduit à une empreinte au sol. Cette logique convient mal à des humanoïdes appelés à circuler dans des entrepôts, ateliers ou bureaux denses. Le résultat, s'il se confirme, appuie aussi la thèse d'un transfert sim-to-real efficace pour des comportements complexes, sans collecte coûteuse de téléopération réelle. Il faut toutefois rester prudent: il s'agit d'un preprint, les chiffres détaillés (taux de succès, nombre d'essais, diversité des scènes réelles) ne figurent pas dans le résumé, et la revendication de « première » approche reste à vérifier. Une démonstration sur un seul robot ne vaut pas un déploiement. Le contexte est celui d'une course aux VLA, de Pi-0 de Physical Intelligence à GR00T de NVIDIA ou Helix de Figure, surtout orientés vers la manipulation. TANGO déplace l'effort vers la locomotion pilotée par le langage et la perception, avec une plateforme accessible, le G1 d'Unitree, très répandue dans les laboratoires. Les approches modulaires, qui séparent perception, planification et contrôle, restent la référence industrielle et servent ici de point de comparaison. Les suites probables sont l'ouverture du code ou des données, des tests sur d'autres morphologies et, surtout, une évaluation en environnements dynamiques et en conditions de production.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
DaViNCi : un jeu de données pour la navigation extérieure vision-langage avec actions continues
4arXiv cs.RO 

DaViNCi : un jeu de données pour la navigation extérieure vision-langage avec actions continues

Un article de recherche publié sur arXiv (2608.11901) présente DaViNCi (Dynamic Vision-and-Language Navigation in Continuous Environment), premier jeu de données de navigation vision-langage (VLN) en extérieur combinant actions continues et éléments dynamiques imprévisibles, avec six cartes distinctes et 6 933 trajectoires au total. Contrairement aux datasets VLN outdoor existants, construits sur des graphes topologiques fixes et discrets, DaViNCi impose à l'agent de se déplacer avec des commandes continues tout en réagissant à des éléments mobiles qui modifient l'environnement en temps réel. Les expériences comparatives montrent que le taux de réussite chute de plus de 10 % en configuration discrète par rapport aux jeux de données précédents, et la baisse est encore plus marquée en configuration continue. Les auteurs isolent également l'impact respectif de la granularité des actions et de la présence d'éléments dynamiques sur la performance des agents. Le dataset et les ressources associées sont disponibles sur le site du projet. Ce résultat contredit l'idée que les agents VLN actuels, entraînés et évalués sur des graphes topologiques figés, seraient prêts pour un déploiement réel en extérieur, et expose l'écart persistant entre bancs d'essai simulés et conditions réelles rencontrées par les robots mobiles et les AMR devant naviguer parmi piétons, véhicules ou obstacles temporaires. Pour les équipes qui développent des agents de navigation autonome guidés par le langage, qu'il s'agisse de robots de livraison, d'inspection ou de plateformes humanoïdes mobiles, ce benchmark offre un cadre d'évaluation plus exigeant que les datasets discrets utilisés jusqu'ici. Il souligne surtout que le passage à des actions continues, plus proches du contrôle moteur réel, reste un facteur de fragilité majeur pour les modèles de navigation, un enjeu direct pour le transfert sim-to-real que l'industrie robotique cherche à valider avant tout déploiement commercial. DaViNCi s'inscrit dans l'évolution du champ VLN, d'abord développé en environnement intérieur avant de s'étendre progressivement à l'extérieur ces dernières années via des jeux de données construits sur des graphes topologiques discrets, qui simplifiaient la tâche d'entraînement mais s'éloignaient des conditions réelles de terrain où les trajectoires ne sont pas prédéfinies. En introduisant simultanément mouvement continu et dynamique environnementale, DaViNCi se positionne comme un nouveau standard d'évaluation, plus difficile que les benchmarks VLN outdoor précédents. Les auteurs présentent ce travail comme une étape vers des agents de navigation capables d'opérer dans des environnements urbains réalistes, et mettent le jeu de données à disposition de la communauté de recherche pour mesurer les progrès futurs sur ce terrain plus exigeant.

RecherchePaper
1 source