Aller au contenu principal
Vers des modèles du monde unifiés pour la navigation visuelle par planification et anticipation augmentées de mémoire
RecherchearXiv cs.RO 

Vers des modèles du monde unifiés pour la navigation visuelle par planification et anticipation augmentées de mémoire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente UniWM, un « world model » unifié et augmenté par mémoire pour la navigation visuelle des agents incarnés, détaillé dans une version mise à jour d'un article arXiv (2510.08713v3). Le système fusionne, au sein d'un seul backbone autorégressif multimodal, la prévision visuelle égocentrique des états futurs et la planification d'actions, évitant le découplage classique entre ces deux modules qui provoque un désalignement état-action dans les architectures modulaires habituelles. Un mécanisme de mémoire hiérarchique combine indices perceptifs à court terme et contexte de trajectoire à long terme pour maintenir un raisonnement stable sur des horizons étendus. Testé sur quatre bancs d'essai (Go Stanford, ReCon, SCAND, HuRoN) ainsi que sur le 1X Humanoid Dataset, issu du fabricant de robots humanoïdes 1X Technologies, UniWM améliore le taux de réussite de navigation jusqu'à 30% face aux meilleures références existantes, réduit sensiblement les erreurs de trajectoire, et généralise en zero-shot sur le jeu de données inédit TartanDrive. Code et modèles sont publiés en open source sur GitHub, sous UWMILab/UniWM.

Le résultat cible un point de friction connu en robotique embarquée : les piles de navigation modulaires, qui séparent planification et modélisation visuelle, s'adaptent mal aux scénarios dynamiques ou inédits faute d'alignement entre prédiction et décision. En ancrant explicitement l'action sur des états futurs imaginés au sein d'un modèle unique entraîné de bout en bout, UniWM illustre une alternative aux pipelines fragmentés, un enjeu concret pour les intégrateurs qui déploient des robots mobiles ou humanoïdes en environnement non structuré. Le transfert réussi vers un jeu de données humanoïde suggère une passerelle entre navigation mobile classique et locomotion humanoïde, même si ces gains restent mesurés sur des bancs d'essai académiques standardisés, pas en conditions réelles de déploiement.

UniWM s'inscrit dans la tendance de recherche vers des modèles du monde unifiés, où prévision visuelle et contrôle fusionnent dans un système génératif unique plutôt qu'en sous-modules séparés, une logique voisine de celle poursuivie par les laboratoires développant des modèles vision-langage-action pour la manipulation robotique. Porté par le UWMILab, le projet met code et poids à disposition de la communauté académique sans annonce de partenariat industriel ni de calendrier de déploiement pilote, et aucun acteur européen n'apparaît dans les benchmarks utilisés. La prochaine étape annoncée reste l'appropriation du code par les chercheurs en navigation visuelle et robotique incarnée.

À lire aussi

Modélisation du monde conditionnée par le langage pour la navigation visuelle
1arXiv cs.RO 

Modélisation du monde conditionnée par le langage pour la navigation visuelle

Une équipe de chercheurs publie sur arXiv (2603.26741, version 2) un travail sur la navigation visuelle conditionnée par le langage, baptisée LCVN. Dans cette tâche, un agent incarné doit suivre une instruction en langage naturel en ne disposant que d'une observation égocentrique initiale, sans image du but. La perception et le contrôle continu doivent donc être guidés uniquement par le texte. Les auteurs introduisent le jeu de données LCVN, qui regroupe 39 016 trajectoires et 117 048 instructions vérifiées par des humains, couvrant des environnements et des styles de consigne variés. Ils comparent deux approches. La première, l'imagination latente, associe un modèle du monde à base de diffusion (LCVN-WM), qui imagine les observations futures, à un agent acteur-critique (LCVN-AC) dont la politique est apprise entièrement dans cet espace latent imaginé. La seconde, la prédiction autorégressive unifiée (LCVN-Uni), utilise un seul backbone multimodal qui prédit actions et observations en une passe sur une séquence de tokens partagée. Les résultats montrent que les deux approches sont complémentaires. L'imagination latente produit des déroulés plus cohérents dans le temps, tandis que la prédiction unifiée généralise mieux à des environnements jamais vus. Pour un ingénieur robotique ou un intégrateur, l'enseignement porte sur l'arbitrage d'architecture entre un modèle du monde explicite, utile pour la planification, et un modèle unique de type VLA (vision-langage-action), plus robuste hors distribution. Des ablations isolent l'effet du guidage linguistique, des signaux de conditionnement et du style d'instruction. Elles permettent de savoir si le goulot d'étranglement vient de l'ancrage du langage ou de la modélisation de la dynamique. Cette distinction est précieuse pour orienter les investissements, entre meilleures données langagières et meilleurs modèles dynamiques. Il faut cependant rester prudent : il s'agit d'un travail académique évalué sur un benchmark, sans déploiement sur robot physique annoncé. Il ne dit rien du transfert sim-to-real ni des temps de latence en conditions industrielles. Ce travail s'inscrit dans la longue tradition de la navigation visuelle conditionnée par un but image, qui sert de banc d'essai à l'IA incarnée depuis des années. Il rejoint la tendance actuelle qui combine modèles du monde génératifs et politiques linguistiques, portée par des modèles du monde comme ceux de la famille Genie ou Cosmos et par les VLA généralistes (Pi-0, GR00T, Helix), qui visent surtout la manipulation. La navigation par instruction reste moins couverte par ces modèles. Le jeu de données, relativement volumineux pour la tâche, peut servir de référence commune. Aucune suite commerciale ni calendrier de pilote n'est annoncé. La prochaine étape logique serait de tester ces approches hybrides sur du matériel réel, ou d'unifier imagination latente et prédiction autorégressive dans une même architecture.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets
2arXiv cs.RO 

EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets

Une équipe de chercheurs a publié EffiNav, un framework de navigation robotique orientée-objet (Object Goal Navigation, ObjNav) qui fusionne perception de profondeur et modèles vision-langage pour améliorer l'efficacité des trajectoires d'exploration en environnement inconnu. La contribution, déposée en preprint sur arXiv (2606.18634) en juin 2026, évalue le système sur deux simulateurs de référence du domaine, HM3D (Habitat Matterport 3D) et OVON (Open-Vocabulary Object goal Navigation), puis le valide sur robots physiques en conditions réelles. Les auteurs l'étendent également à GOAT-BENCH, un benchmark de navigation avec mémoire augmentée, pour démontrer la généralisation du framework au-delà du protocole ObjNav standard. Sur les deux métriques habituelles du domaine, taux de succès (SR) et succès pondéré par longueur de chemin (SPL), EffiNav égale ou dépasse les baselines récentes, sans que le preprint ne communique de valeurs numériques absolues permettant une comparaison chiffrée directe. L'apport principal porte moins sur le taux de réussite brut que sur le SPL, qui pénalise les trajets inutilement longs. C'est précisément là que les approches actuelles divergent : les modèles entraînés end-to-end, y compris certains VLA (Vision-Language-Action), peinent à généraliser à de nouveaux environnements, tandis que les frameworks modulaires sans apprentissage accumulent des allers-retours redondants et revisitent des zones déjà explorées. EffiNav prétend adresser ces deux pathologies simultanément en combinant une estimation de la profondeur pour la représentation géométrique de l'espace et un modèle vision-langage pour l'interprétation sémantique. Pour les intégrateurs de robots de service ou les décideurs B2B, l'efficacité de trajectoire est directement liée au temps disponible pour les tâches secondaires, donc à la rentabilité opérationnelle d'un déploiement en entrepôt ou en environnement indoor. Le champ ObjNav s'est structuré autour de l'écosystème Habitat de Meta AI Research, qui fournit les simulateurs HM3D et OVON utilisés ici. Les approches concurrentes incluent des pipelines modulaires à cartographie explicite comme SemExp ou OpenFMNav, et des VLA appliqués à la navigation. EffiNav se positionne comme un framework hybride ne nécessitant ni encodeurs supplémentaires lourds ni réentraînement complet par domaine. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le preprint ; la prochaine étape naturelle serait une validation sur des plateformes AMR variées pour confirmer le transfert sim-to-real sur des morphologies autres que celles testées.

RecherchePaper
1 source
GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives
3arXiv cs.RO 

GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives

Un nouveau papier de recherche publié le 14 septembre 2026 sur arXiv (référence 2609.14561, soumission inédite, non encore relue par les pairs) présente GLAM, un modèle du monde latent conditionné par un objectif et entraîné sur une mémoire spatiotemporelle globale, ainsi que GLAM NAV, le système de navigation complet construit autour de ce modèle. À partir de tokens de carte historiques, d'un objectif de navigation et de la pose courante du robot, GLAM prédit conjointement les représentations futures de la carte et les latents de points de passage centrés sur le robot, dans un espace de représentation partagé. Le modèle suit un paradigme de prédiction latente de type JEPA, opère directement sur des tokens latents au niveau de la carte plutôt que sur une reconstruction d'images RGB, et s'appuie sur un encodeur-décodeur de waypoints pré-entraîné pour superviser et décoder les plans de navigation. Les données d'entraînement proviennent de trajectoires expertes de la tâche ObjectNav rejouées dans le simulateur Habitat sur les scènes HM3D v0.2, découpées en échantillons de prédiction à plusieurs échelles temporelles. Sur un sous-ensemble contrôlé du benchmark HM3D-ObjectNav, GLAM NAV dépasse une base de référence BSC-Nav reproduite, à la fois en taux de succès et en SPL (succès pondéré par la longueur du chemin). L'intérêt pour la robotique mobile tient à l'approche : en prédisant l'évolution de la mémoire spatiale et l'intention de navigation dans un même espace latent, sans reconstruire des images pixel par pixel, GLAM illustre la piste des modèles du monde compacts appliqués à l'exploration active et à la navigation sémantique, plutôt qu'aux seules politiques d'action de type VLA. Pour les intégrateurs travaillant sur des robots autonomes en environnement inconnu, ce type d'approche promet une planification moins coûteuse en calcul que les pipelines classiques de reconstruction 3D. Le résultat reste toutefois circonscrit à un sous-ensemble contrôlé en simulation, sans validation sur robot réel ni déploiement annoncé, ce qui limite pour l'instant la portée de la comparaison à BSC-Nav. Le travail s'inscrit dans la lignée des architectures JEPA (prédiction dans l'espace latent plutôt que reconstruction pixel) appliquées cette fois à la navigation robotique, en s'appuyant sur l'écosystème de simulation Habitat et le jeu de scènes HM3D largement utilisés par la communauté ObjectNav. Le résumé ne précise ni les auteurs ni leur institution, ni de calendrier de validation matérielle ; il s'agit à ce stade d'une contribution académique en amont de toute intégration industrielle.

RecherchePaper
1 source
Mem-World : modèles du monde conditionnés par l'action et augmentés par la mémoire pour la manipulation robotique persistante
4arXiv cs.RO 

Mem-World : modèles du monde conditionnés par l'action et augmentés par la mémoire pour la manipulation robotique persistante

Des chercheurs ont publié Mem-World sur arXiv (réf. 2606.18960, juin 2026), un modèle du monde multi-vues augmenté par mémoire pour la manipulation robotique. Le problème adressé est fondamental aux modèles du monde conditionnés par l'action (action-conditioned world models) : lors d'une tâche de manipulation, l'effecteur terminal occulte fréquemment la scène, et les mouvements rapides de la caméra embarquée au poignet rendent l'observation courante insuffisante pour prédire les vues futures, poussant les modèles à halluciner ou oublier des détails observés antérieurement. L'innovation centrale est W-VMem, une mémoire indicée par surfels (éléments de surface 3D) en 4D, centrée sur la vue poignet, qui ancre les observations historiques à des éléments de surface évoluant dans le temps. Cette structure permet une récupération de contexte conditionnée sur les actions futures et consciente de la géométrie de scène, via rendu et scoring basés sur les surfels. Sur les tâches de long horizon, le taux de réussite progresse de 58 % à 72 % grâce à la génération de données synthétiques, et la corrélation de Pearson entre évaluations simulées et performances réelles s'améliore de 14,5 % par rapport à Ctrl-World, le modèle de référence. Ce gain en corrélation est directement actionnable pour les équipes robotique : il indique qu'on peut davantage faire confiance aux rollouts simulés pour prédire le comportement réel d'une politique, réduisant la dépendance aux expérimentations physiques coûteuses. L'hallucination de scène était jusqu'ici un verrou majeur à l'utilisation des world models pour l'entraînement de politiques dextres ; en séparant explicitement quand et où chaque élément a été observé, W-VMem produit un contexte historique non-redondant et pertinent. Il convient toutefois de noter que les scénarios de test et les métriques d'évaluation ne sont pas détaillés dans le résumé disponible, ce qui limite l'interprétation directe des chiffres annoncés. Les world models conditionnés par l'action sont apparus d'abord en jeu vidéo et conduite autonome (DreamerV3, GAIA-1) avant d'être adaptés à la manipulation, domaine plus exigeant en raison des occlusions proches et de la dynamique de caméra embarquée. Ctrl-World est la référence directe contre laquelle Mem-World se positionne. Cette publication reste un preprint, non encore évalué par des pairs, sans partenaire industriel ni timeline de déploiement annoncé. Les suites naturelles incluent une évaluation sur des benchmarks standardisés comme RLBench et une intégration dans des pipelines de modèles Visual Language Action (VLA), où la cohérence temporelle des rollouts est un prérequis à l'entraînement à grande échelle.

RechercheOpinion
1 source