Aller au contenu principal
GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives
RecherchearXiv cs.RO 

GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un nouveau papier de recherche publié le 14 septembre 2026 sur arXiv (référence 2609.14561, soumission inédite, non encore relue par les pairs) présente GLAM, un modèle du monde latent conditionné par un objectif et entraîné sur une mémoire spatiotemporelle globale, ainsi que GLAM NAV, le système de navigation complet construit autour de ce modèle. À partir de tokens de carte historiques, d'un objectif de navigation et de la pose courante du robot, GLAM prédit conjointement les représentations futures de la carte et les latents de points de passage centrés sur le robot, dans un espace de représentation partagé. Le modèle suit un paradigme de prédiction latente de type JEPA, opère directement sur des tokens latents au niveau de la carte plutôt que sur une reconstruction d'images RGB, et s'appuie sur un encodeur-décodeur de waypoints pré-entraîné pour superviser et décoder les plans de navigation. Les données d'entraînement proviennent de trajectoires expertes de la tâche ObjectNav rejouées dans le simulateur Habitat sur les scènes HM3D v0.2, découpées en échantillons de prédiction à plusieurs échelles temporelles. Sur un sous-ensemble contrôlé du benchmark HM3D-ObjectNav, GLAM NAV dépasse une base de référence BSC-Nav reproduite, à la fois en taux de succès et en SPL (succès pondéré par la longueur du chemin).

L'intérêt pour la robotique mobile tient à l'approche : en prédisant l'évolution de la mémoire spatiale et l'intention de navigation dans un même espace latent, sans reconstruire des images pixel par pixel, GLAM illustre la piste des modèles du monde compacts appliqués à l'exploration active et à la navigation sémantique, plutôt qu'aux seules politiques d'action de type VLA. Pour les intégrateurs travaillant sur des robots autonomes en environnement inconnu, ce type d'approche promet une planification moins coûteuse en calcul que les pipelines classiques de reconstruction 3D. Le résultat reste toutefois circonscrit à un sous-ensemble contrôlé en simulation, sans validation sur robot réel ni déploiement annoncé, ce qui limite pour l'instant la portée de la comparaison à BSC-Nav.

Le travail s'inscrit dans la lignée des architectures JEPA (prédiction dans l'espace latent plutôt que reconstruction pixel) appliquées cette fois à la navigation robotique, en s'appuyant sur l'écosystème de simulation Habitat et le jeu de scènes HM3D largement utilisés par la communauté ObjectNav. Le résumé ne précise ni les auteurs ni leur institution, ni de calendrier de validation matérielle ; il s'agit à ce stade d'une contribution académique en amont de toute intégration industrielle.

Dans nos dossiers

À lire aussi

Vers des modèles du monde unifiés pour la navigation visuelle par planification et anticipation augmentées de mémoire
1arXiv cs.RO 

Vers des modèles du monde unifiés pour la navigation visuelle par planification et anticipation augmentées de mémoire

Une équipe de recherche présente UniWM, un « world model » unifié et augmenté par mémoire pour la navigation visuelle des agents incarnés, détaillé dans une version mise à jour d'un article arXiv (2510.08713v3). Le système fusionne, au sein d'un seul backbone autorégressif multimodal, la prévision visuelle égocentrique des états futurs et la planification d'actions, évitant le découplage classique entre ces deux modules qui provoque un désalignement état-action dans les architectures modulaires habituelles. Un mécanisme de mémoire hiérarchique combine indices perceptifs à court terme et contexte de trajectoire à long terme pour maintenir un raisonnement stable sur des horizons étendus. Testé sur quatre bancs d'essai (Go Stanford, ReCon, SCAND, HuRoN) ainsi que sur le 1X Humanoid Dataset, issu du fabricant de robots humanoïdes 1X Technologies, UniWM améliore le taux de réussite de navigation jusqu'à 30% face aux meilleures références existantes, réduit sensiblement les erreurs de trajectoire, et généralise en zero-shot sur le jeu de données inédit TartanDrive. Code et modèles sont publiés en open source sur GitHub, sous UWMILab/UniWM. Le résultat cible un point de friction connu en robotique embarquée : les piles de navigation modulaires, qui séparent planification et modélisation visuelle, s'adaptent mal aux scénarios dynamiques ou inédits faute d'alignement entre prédiction et décision. En ancrant explicitement l'action sur des états futurs imaginés au sein d'un modèle unique entraîné de bout en bout, UniWM illustre une alternative aux pipelines fragmentés, un enjeu concret pour les intégrateurs qui déploient des robots mobiles ou humanoïdes en environnement non structuré. Le transfert réussi vers un jeu de données humanoïde suggère une passerelle entre navigation mobile classique et locomotion humanoïde, même si ces gains restent mesurés sur des bancs d'essai académiques standardisés, pas en conditions réelles de déploiement. UniWM s'inscrit dans la tendance de recherche vers des modèles du monde unifiés, où prévision visuelle et contrôle fusionnent dans un système génératif unique plutôt qu'en sous-modules séparés, une logique voisine de celle poursuivie par les laboratoires développant des modèles vision-langage-action pour la manipulation robotique. Porté par le UWMILab, le projet met code et poids à disposition de la communauté académique sans annonce de partenariat industriel ni de calendrier de déploiement pilote, et aucun acteur européen n'apparaît dans les benchmarks utilisés. La prochaine étape annoncée reste l'appropriation du code par les chercheurs en navigation visuelle et robotique incarnée.

RecherchePaper
1 source
WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée
2arXiv cs.RO 

WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée

Des chercheurs ont publié WAM-Nav (Latent World-Action Model for Navigation), un système de navigation visuelle incarnée qui couple la génération d'actions et la prévision visuelle dans un seul modèle, déposé sur arXiv en juin 2026 (réf. 2606.04907). L'architecture repose sur un Diffusion Transformer partagé qui effectue une diffusion jointe asymétrique : il génère simultanément des actions à long horizon et une anticipation visuelle à court horizon, sans recourir aux rollouts autorégressifs multi-étapes qui alourdissent la latence d'inférence. Un mécanisme de conditionnement contextuel à double flux intègre l'historique d'ego-motion à l'échelle de l'épisode et les observations visuelles séquentielles, favorisant des trajectoires lisses et cohérentes. Un module d'alignement d'objectif unifié permet à WAM-Nav de gérer trois modes dans une seule politique : Image-Goal, Point-Goal et exploration libre (No-Goal). Sur les benchmarks ClutterScenes et InternScenes, le système améliore les taux de réussite de 15,7 % en Image-Goal et de 3,3 % en Point-Goal. En déploiement réel, WAM-Nav atteint 85 % de taux de succès moyen sur des environnements intérieurs et extérieurs variés, sans fine-tuning, soit un transfert sim-to-real zéro-shot. Ce résultat intéresse directement les intégrateurs de robotique mobile pour deux raisons concrètes. D'abord, la résolution simultanée de l'action et de l'imagination visuelle dans un seul réseau réduit l'accumulation d'erreurs typique des architectures modulaires, où le prédicteur de scène et le module de politique sont entraînés séparément et se propagent mutuellement leurs erreurs. Ensuite, un taux de 85 % en zéro-shot sur des environnements variés représente un indicateur sérieux, même si les conditions de test (densité d'obstacles, vitesses, types de sols) ne sont pas détaillées dans le résumé et méritent d'être examinées dans le papier complet. Pour un COO ou un décideur B2B, cette architecture suggère des robots de navigation capables de s'adapter à de nouveaux scénarios sans collecte de données coûteuse sur site. Le sim-to-real gap reste l'un des blocages majeurs de la robotique mobile autonome depuis des années : les politiques entraînées en simulation échouent souvent au contact du monde réel en raison des différences de rendu, de dynamique et de bruit des capteurs. WAM-Nav s'inscrit dans une vague de travaux qui combinent modèles de diffusion pour la génération d'actions et représentations latentes du monde, dans la lignée des World Models de type RSSM ou des VLA comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA. Sur le plan concurrentiel, des approches comme NoMaD, ViNT ou les stacks Nav2/ROS 2 restent des références opérationnelles sur AMR commerciaux, et WAM-Nav devra être comparé à ces systèmes dans des conditions contrôlées identiques pour confirmer sa supériorité pratique. L'étape suivante naturelle serait une validation sur des plateformes matérielles réelles en conditions industrielles, dont aucun partenariat ni timeline n'est annoncé à ce stade.

RecherchePaper
1 source
RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
3arXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs. Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé. La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

RecherchePaper
1 source
Mémoire explicite guidée par l'avantage pour la navigation sociale
4arXiv cs.RO 

Mémoire explicite guidée par l'avantage pour la navigation sociale

Une équipe de recherche publie sur arXiv (référence 2608.25610v1) un nouvel agent de navigation robotique doté d'une mémoire explicite non paramétrique, conçu pour la navigation sociale, c'est à dire le déplacement d'un robot au milieu d'humains. Le constat de départ est que les politiques robotiques actuelles, entraînées par imitation learning ou par apprentissage par renforcement (RL) classiques, stockent tout leur comportement dans les poids du réseau de neurones, ce qui les rend fragiles face aux situations rares mais critiques, comme un risque de collision avec un piéton. La solution proposée consiste à indexer explicitement les séquences d'étapes ayant mené à ces événements critiques dans une mémoire externe, plutôt que de tout confier à la représentation apprise. Techniquement, cette mémoire est intégrée à une architecture PPO récurrente (Proximal Policy Optimization), où les états cachés du réseau servent de clé de récupération pour capter la dynamique spatio-temporelle continue de l'environnement, et où les signaux d'avantage du RL guident la priorisation des événements rares à fort impact. L'agent est entraîné en simulation, combinant rendu photoréaliste et simulation de foule non visuelle. L'apport principal tient à deux effets combinés. D'une part, l'agent peut continuer à apprendre pendant son déploiement en collectant des données de ses propres épisodes de test, ce qui améliore sa généralisation face à des comportements humains hors distribution (OOD), un point faible connu des politiques purement paramétriques. D'autre part, cette mémoire externe atténue en partie l'écart classique entre simulation et monde réel (sim-to-real gap), puisque certaines décisions peuvent désormais s'appuyer sur des données réelles collectées après l'entraînement, et non uniquement sur des poids figés issus de la simulation. Pour les intégrateurs travaillant sur des robots mobiles évoluant en environnement humain, cela pointe vers des architectures hybrides mémoire plus apprentissage continu comme piste pour fiabiliser la sécurité sans réentraînement complet. Le travail s'inscrit dans la lignée des méthodes RL récurrentes de type PPO et des recherches sur la mémoire épisodique non paramétrique, sans affiliation industrielle ni nom d'entreprise cités dans la publication. Il reste à ce stade une validation en simulation, sans annonce de pilote terrain ni de calendrier de déploiement réel.

RecherchePaper
1 source