
GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives
Un nouveau papier de recherche publié le 14 septembre 2026 sur arXiv (référence 2609.14561, soumission inédite, non encore relue par les pairs) présente GLAM, un modèle du monde latent conditionné par un objectif et entraîné sur une mémoire spatiotemporelle globale, ainsi que GLAM NAV, le système de navigation complet construit autour de ce modèle. À partir de tokens de carte historiques, d'un objectif de navigation et de la pose courante du robot, GLAM prédit conjointement les représentations futures de la carte et les latents de points de passage centrés sur le robot, dans un espace de représentation partagé. Le modèle suit un paradigme de prédiction latente de type JEPA, opère directement sur des tokens latents au niveau de la carte plutôt que sur une reconstruction d'images RGB, et s'appuie sur un encodeur-décodeur de waypoints pré-entraîné pour superviser et décoder les plans de navigation. Les données d'entraînement proviennent de trajectoires expertes de la tâche ObjectNav rejouées dans le simulateur Habitat sur les scènes HM3D v0.2, découpées en échantillons de prédiction à plusieurs échelles temporelles. Sur un sous-ensemble contrôlé du benchmark HM3D-ObjectNav, GLAM NAV dépasse une base de référence BSC-Nav reproduite, à la fois en taux de succès et en SPL (succès pondéré par la longueur du chemin).
L'intérêt pour la robotique mobile tient à l'approche : en prédisant l'évolution de la mémoire spatiale et l'intention de navigation dans un même espace latent, sans reconstruire des images pixel par pixel, GLAM illustre la piste des modèles du monde compacts appliqués à l'exploration active et à la navigation sémantique, plutôt qu'aux seules politiques d'action de type VLA. Pour les intégrateurs travaillant sur des robots autonomes en environnement inconnu, ce type d'approche promet une planification moins coûteuse en calcul que les pipelines classiques de reconstruction 3D. Le résultat reste toutefois circonscrit à un sous-ensemble contrôlé en simulation, sans validation sur robot réel ni déploiement annoncé, ce qui limite pour l'instant la portée de la comparaison à BSC-Nav.
Le travail s'inscrit dans la lignée des architectures JEPA (prédiction dans l'espace latent plutôt que reconstruction pixel) appliquées cette fois à la navigation robotique, en s'appuyant sur l'écosystème de simulation Habitat et le jeu de scènes HM3D largement utilisés par la communauté ObjectNav. Le résumé ne précise ni les auteurs ni leur institution, ni de calendrier de validation matérielle ; il s'agit à ce stade d'une contribution académique en amont de toute intégration industrielle.
Dans nos dossiers




