
« Des trajets aux étapes : distinguer la progression sémantique de l'exécution locale en navigation vision-langage »
Des chercheurs proposent Route2Step, un nouveau cadre pour la navigation vision-langage (VLN), la tâche où un agent doit suivre une instruction en langage naturel découpée en plusieurs étapes en s'appuyant uniquement sur ses observations visuelles égocentriques. Le problème identifié : les navigateurs actuels, basés sur des modèles vision-langage (VLM), supervisent à la fois le suivi de la progression sémantique dans l'instruction et l'exécution locale des mouvements via une seule prédiction de l'action suivante. Quand l'agent dévie de sa route, impossible alors de savoir s'il a mal identifié la sous-instruction en cours ou s'il a échoué à exécuter la bonne action, ce qui le laisse continuer à décider depuis un état de progression erroné. Route2Step sépare explicitement les deux via une interface au niveau des étapes : un module d'analyse d'instruction (MIA) prédit l'état de progression à partir de l'instruction globale et de l'historique visuel, tandis qu'un module de génération d'action (MAG) produit des séquences d'actions locales conditionnées sur cet état. Pour entraîner le premier module sans étiquetage temporel manuel, les auteurs introduisent E-SPA, une procédure qui aligne automatiquement chaque sous-instruction avec la portion correspondante des démonstrations de route. Sur le benchmark R2R-CE, le taux de réussite (SR) grimpe de 48,1% à 55,3% et le score SPL, qui pénalise les trajectoires inefficaces, de 43,3% à 48,2%, avec 190 000 exemples correctifs au niveau de l'état mais seulement 11 500 états directement supervisés par des labels d'action.
Cette séparation entre "savoir où j'en suis dans l'instruction" et "savoir comment bouger" s'attaque à un problème structurel de l'entraînement en VLN : la confusion des signaux d'erreur. Pour les chercheurs en robotique mobile et les concepteurs d'agents suivant des instructions vocales ou textuelles, c'est une piste concrète pour fiabiliser des systèmes destinés à des usages comme la logistique en entrepôt, l'assistance domestique ou les robots de service guidés par la voix. Le gain en efficacité de supervision est notable : 11 500 états annotés par action suffisent là où l'approche classique exigerait un étiquetage massif de chaque trajectoire, un signal encourageant pour réduire le coût d'entraînement de ces agents avant tout déploiement réel.
Ce travail s'inscrit dans la lignée des benchmarks de navigation continue en environnement 3D, dont R2R-CE (Room-to-Room, Continuous Environments) sert de référence standard pour évaluer des agents suivant des instructions pas à pas dans des scènes réalistes. Les approches précédentes, fondées sur des VLM entraînés par prédiction d'action unique, butaient sur l'ambiguïté que Route2Step cherche à lever. Les auteurs ne se limitent pas à la simulation : des expériences en environnements réels, intérieurs et extérieurs, viennent appuyer l'applicabilité pratique du système, une étape que peu de travaux académiques sur le VLN franchissent. Le code et les démonstrations sont disponibles sur la page du projet, sisyphus-hxy.github.io/Route2Step.




