
LG-VLN : un cadre de navigation vision-langage sans apprentissage préalable, orchestré par états LangGraph
Une équipe de recherche présente LG-VLN, un framework de navigation vision-langage en environnement continu (VLN-CE), dans un preprint arXiv de septembre 2026 (arXiv:2609.15098v1). Contrairement aux méthodes existantes qui s'appuient sur LiDAR ou cameras panoramiques, LG-VLN navigue en zero-shot a partir d'une seule camera RGB monoculaire, grâce a un réseau de reconstruction 3D qui estime profondeur, pose et nuage de points, a des features visuelles CleanDIFT partagées entre géométrie et sémantique, et a une carte de valeur sémantique combinant similarité visuelle et pertinence image-texte via BLIP-2. Tout le pipeline, de l'analyse de l'instruction a la récupération d'échec, est orchestre par LangGraph sous forme de graphe d'états a transitions conditionnelles. Sur un sous-ensemble fixe de 550 épisodes du split val-unseen de R2R-CE, le système atteint 21,3% de réussite et 12,1% de SPL, le code devant être publie ultérieurement.
Ces résultats, modestes compares aux meilleures méthodes VLN-CE qui s'appuient sur des capteurs plus riches, montrent néanmoins qu'une navigation purement monoculaire et zero-shot reste possible dans des scènes 3D inédites, sans reentrainement dédié a l'environnement. Pour les intégrateurs robotiques, l'enjeu est économique: une navigation fiable sans LiDAR ni vues panoramiques allégé le cout matériel des plateformes mobiles. Le choix de LangGraph illustre aussi une tendance plus large, l'importation d'outils d'orchestration issus des agents LLM dans des pipelines robotiques jusque-la gérés par des machines a états codées en dur. Les ablations confirment que le partage de features sémantiques entre géométrie et navigation, renforce par la fusion avec BLIP-2, explique l'essentiel du gain, validant l'hypothèse que l'incohérence spatiale-sémantique freinait les pipelines séparés.
La VLN-CE vise a faire suivre a des robots des instructions en langage naturel dans des bâtiments jamais vus, un objectif longtemps freine par des capteurs géométriques couteux ou un entrainement lourd propre a chaque environnement. LG-VLN s'appuie plutôt sur des modules de vision pré-entraines existants, CleanDIFT et BLIP-2. Le travail reste une publication de recherche en navigation, distincte des architectures vision-langage-action déployées sur des robots humanoïdes comme Optimus, Pi-0 ou GR00T N2, sans déploiement industriel ni partenaire commercial annonce. La suite dépendra de la publication du code, promise mais non datée, pour vérifier les scores au-delà des 550 épisodes testes.
Dans nos dossiers




