Aller au contenu principal
Modélisation du monde conditionnée par le langage pour la navigation visuelle
RecherchearXiv cs.RO 

Modélisation du monde conditionnée par le langage pour la navigation visuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2603.26741, version 2) un travail sur la navigation visuelle conditionnée par le langage, baptisée LCVN. Dans cette tâche, un agent incarné doit suivre une instruction en langage naturel en ne disposant que d'une observation égocentrique initiale, sans image du but. La perception et le contrôle continu doivent donc être guidés uniquement par le texte. Les auteurs introduisent le jeu de données LCVN, qui regroupe 39 016 trajectoires et 117 048 instructions vérifiées par des humains, couvrant des environnements et des styles de consigne variés. Ils comparent deux approches. La première, l'imagination latente, associe un modèle du monde à base de diffusion (LCVN-WM), qui imagine les observations futures, à un agent acteur-critique (LCVN-AC) dont la politique est apprise entièrement dans cet espace latent imaginé. La seconde, la prédiction autorégressive unifiée (LCVN-Uni), utilise un seul backbone multimodal qui prédit actions et observations en une passe sur une séquence de tokens partagée.

Les résultats montrent que les deux approches sont complémentaires. L'imagination latente produit des déroulés plus cohérents dans le temps, tandis que la prédiction unifiée généralise mieux à des environnements jamais vus. Pour un ingénieur robotique ou un intégrateur, l'enseignement porte sur l'arbitrage d'architecture entre un modèle du monde explicite, utile pour la planification, et un modèle unique de type VLA (vision-langage-action), plus robuste hors distribution. Des ablations isolent l'effet du guidage linguistique, des signaux de conditionnement et du style d'instruction. Elles permettent de savoir si le goulot d'étranglement vient de l'ancrage du langage ou de la modélisation de la dynamique. Cette distinction est précieuse pour orienter les investissements, entre meilleures données langagières et meilleurs modèles dynamiques. Il faut cependant rester prudent : il s'agit d'un travail académique évalué sur un benchmark, sans déploiement sur robot physique annoncé. Il ne dit rien du transfert sim-to-real ni des temps de latence en conditions industrielles.

Ce travail s'inscrit dans la longue tradition de la navigation visuelle conditionnée par un but image, qui sert de banc d'essai à l'IA incarnée depuis des années. Il rejoint la tendance actuelle qui combine modèles du monde génératifs et politiques linguistiques, portée par des modèles du monde comme ceux de la famille Genie ou Cosmos et par les VLA généralistes (Pi-0, GR00T, Helix), qui visent surtout la manipulation. La navigation par instruction reste moins couverte par ces modèles. Le jeu de données, relativement volumineux pour la tâche, peut servir de référence commune. Aucune suite commerciale ni calendrier de pilote n'est annoncé. La prochaine étape logique serait de tester ces approches hybrides sur du matériel réel, ou d'unifier imagination latente et prédiction autorégressive dans une même architecture.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
1arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source
WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée
2arXiv cs.RO 

WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée

Un article publié sur arXiv (référence 2608.07267, catégorie "cross-listing" signalant un croisement entre disciplines) présente WNM-3D, un modèle de navigation "world-action" conçu pour la navigation vision-langage en boucle fermée, c'est-à-dire des robots qui suivent des instructions en langage naturel à partir de flux vidéo égocentriques. Le système combine un encodeur de géométrie gelé, qui extrait des représentations 3D à partir de l'historique RGB monoculaire de l'agent, avec un adaptateur entraînable appelé 3D Scene-to-Token, qui convertit ces représentations en un préfixe de longueur fixe injecté dans un Transformer de diffusion. Grâce à un mécanisme d'attention "block-causal", ce contexte géométrique conditionne à la fois la génération des futures vues visuelles et celle des actions de navigation. L'entraînement se déroule en trois étapes : un ajustement supervisé sur des démonstrations générées par l'algorithme A*, une adaptation de type DAgger sur les états visités par la politique elle-même, puis une optimisation en boucle fermée via une méthode appelée DanceGRPO. Sur le benchmark GN-Bench, WNM-3D surpasse des politiques de navigation basées sur des modèles vision-langage classiques ainsi que sa propre variante conditionnée en 2D, avec une meilleure cohérence entre flux visuel et action et une erreur de mouvement visuel réduite sur un jeu d'évaluation proche de l'objectif. L'intérêt de ces travaux réside dans le diagnostic qu'ils posent sur les approches VLA (vision-language-action) actuelles, qui associent directement observations et instructions à des actions sans modéliser explicitement comment la scène visuelle doit évoluer sous l'effet du mouvement prédit. En ancrant la prédiction conjointe d'images futures et d'actions dans une représentation 3D persistante plutôt que dans un simple contexte 2D, WNM-3D vise à réduire la dérive en boucle fermée, un problème classique où les erreurs de navigation s'accumulent au fil des pas de temps. Pour les intégrateurs de robots mobiles autonomes, ce résultat suggère qu'un conditionnement géométrique explicite améliore la robustesse par rapport à des politiques purement basées sur des modèles vision-langage préentraînés, sans toutefois constituer une preuve de déploiement réel : les résultats restent circonscrits à un benchmark, sans essai terrain ni robot physique mentionné. Ce travail s'inscrit dans la lignée des modèles génératifs "world-action" (WAM), une famille d'approches qui prédisent conjointement observations futures et actions mais qui, jusqu'ici, ne conditionnaient pas cette génération sur une représentation géométrique de l'historique observé pour la navigation continue. WNM-3D se positionne explicitement contre les politiques VLA de référence et contre une variante 2D du même modèle, utilisée comme ablation pour isoler l'apport du conditionnement 3D. Aucun partenariat industriel, aucun calendrier de déploiement ni acteur commercial n'est mentionné dans l'abstract, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit prêt à l'intégration.

RechercheActu
1 source
Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
3arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source
Réseau de perception visuelle multitâche conditionné par un LLM pour la navigation autonome
4arXiv cs.RO 

Réseau de perception visuelle multitâche conditionné par un LLM pour la navigation autonome

Un article de recherche publié en septembre 2026 sur arXiv (référence 2609.14297) décrit un nouveau framework de navigation autonome pour robots de service, baptisé VL-Navigation. Le système associe un réseau de perception visuelle multi-tâches à un grand modèle de langage (LLM) capable d'interpréter des commandes vocales ou textuelles de l'utilisateur. Contrairement aux approches classiques de planification de trajectoire comme A, RRT, DiPPer ou ViT-A, qui s'appuient sur une carte 2D globale et se dégradent avec l'accumulation de dérive odométrique et d'erreurs de capteurs, VL-Navigation génère des plans d'action séquentiels à partir d'indices visuels locaux et d'instructions géométriques égocentriques. La localisation est réinitialisée à chaque cible intermédiaire, ce qui limite l'accumulation de dérive sans nécessiter la maintenance d'une carte globale cohérente. Les chercheurs annoncent des résultats supérieurs aux méthodes existantes sur des données réelles et simulées, sans toutefois publier dans le résumé de chiffres précis de taux de réussite ou de temps de cycle, ce qui invite à la prudence tant que le travail n'a pas été validé par une relecture par les pairs. Le code source est disponible publiquement sur GitHub, sous le dépôt PraveenSingh24/VL-Navigation. Pour les intégrateurs de robots de service, en hôtellerie, en logistique légère ou en environnement hospitalier, ce travail cible un point de friction bien réel: le coût de maintenance des cartes SLAM dans des lieux qui évoluent constamment, mobilier déplacé, couloirs encombrés, zones en travaux. En confiant à un LLM la traduction d'instructions naturelles en plans d'action locaux plutôt qu'à une carte globale figée, l'approche s'inscrit dans la tendance plus large des modèles vision-langage-action qui cherchent à remplacer une partie du pipeline de cartographie classique par du raisonnement contextuel embarqué. Si les résultats se confirment à plus grande échelle, une telle méthode pourrait réduire le temps d'ingénierie nécessaire au déploiement de flottes mobiles dans des environnements partiellement inconnus, un frein récurrent à la commercialisation de la robotique de service au-delà des démonstrations contrôlées. La dérive odométrique cumulative reste un problème non résolu depuis les débuts de la navigation mobile autonome, et les algorithmes de référence cités dans l'article, A, RRT, DiPPer et ViT-A, illustrent les limites successives des approches purement géométriques face à des environnements dynamiques. VL-Navigation se positionne dans la lignée d'autres travaux récents associant modèles de langage et perception visuelle pour la navigation robotique, un champ en pleine expansion en parallèle des modèles VLA appliqués à la manipulation comme Pi-0 ou GR00T N2. Publié comme preprint sans affiliation industrielle mentionnée, l'article ne précise ni calendrier de déploiement pilote ni partenariat commercial; la mise à disposition du code sur GitHub vise avant tout la reproductibilité par la communauté académique, une étape encore éloignée d'une intégration en produit commercial.

RecherchePaper
1 source