Aller au contenu principal
Mem2Ego : la mémoire globale vers égocentrique pour la navigation incarnée à long horizon
RecherchearXiv cs.RO 

Mem2Ego : la mémoire globale vers égocentrique pour la navigation incarnée à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Mem2Ego, un framework de navigation robotique fondé sur les modèles vision-langage (VLM), a été republié le 17 septembre 2026 en version 3 sur arXiv (arXiv:2502.14254), remplaçant une version antérieure du même article de recherche. Le système s'attaque à la navigation incarnée à long horizon : un agent robotique doit explorer un environnement inconnu en combinant raisonnement de sens commun et raisonnement spatial. Concrètement, Mem2Ego associe une mémoire globale, sous forme de carte sémantique ou topologique, à des observations égocentriques en première personne captées par le robot, en récupérant dynamiquement les indices pertinents pour la tâche en cours et en les fusionnant avec la perception locale. L'équipe a évalué la méthode sur deux benchmarks de référence en navigation simulée, HSSD (Habitat Synthetic Scenes Dataset) et HM3D (Habitat-Matterport 3D), ainsi que sur un robot réel, ce qui distingue cette publication de nombreux travaux purement simulés.

L'enjeu dépasse la seule performance sur benchmark. Les approches fondées uniquement sur des LLM traduisent la mémoire globale en descriptions textuelles, ce qui fait perdre l'information géométrique et pénalise le raisonnement spatial dans des environnements complexes. À l'inverse, les approches VLM purement égocentriques traitent la navigation comme un problème de décision partiellement observé, faute de vision d'ensemble, ce qui conduit à des choix sous-optimaux. En articulant les deux, Mem2Ego répond à une limite concrète et documentée du secteur de la navigation incarnée, où le compromis entre représentation langagière et perception directe reste un point de friction pour les intégrateurs travaillant sur des agents autonomes en environnement inconnu. Les auteurs annoncent un gain « significatif » par rapport à l'état de l'art antérieur sur HSSD et HM3D, sans détailler de chiffres précis dans le résumé, une formulation à prendre avec prudence tant qu'aucune métrique chiffrée n'est publiée.

Le travail s'inscrit dans la lignée des recherches combinant LLM et VLM pour l'exploration robotique, un domaine où la tension entre cartes sémantiques textuelles et perception visuelle directe alimente plusieurs lignes de recherche concurrentes. La validation sur robot réel, en plus des environnements simulés HSSD et HM3D, suggère une volonté de dépasser le stade purement algorithmique, sans que l'article ne précise de calendrier de déploiement ni de partenariat industriel à ce stade.

Dans nos dossiers

À lire aussi

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
1arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme
2arXiv cs.RO 

HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme

Un article publié le 7 juillet 2026 sur arXiv présente HiMe, un cadre de mémoire hiérarchique pour les modèles Vision-Language-Action (VLA), ces systèmes qui pilotent robots et bras manipulateurs en combinant vision, langage et commande motrice. Les auteurs identifient ce qu'ils appellent le paradoxe fréquence-compétence : les modèles de raisonnement les plus capables sont trop lents pour le contrôle temps réel, tandis que les modèles rapides manquent de capacité de raisonnement pour les tâches longues et non markoviennes, où l'action dépend de tout l'historique et pas seulement de l'observation immédiate. HiMe répond en découplant l'intelligence du robot en trois couches : un Executor haute fréquence pour l'exécution, un Sentry pour la mémoire de travail, et un Planner pour la stratégie long terme, le tout appuyé par une base de connaissances dynamique capable de s'ajouter, se mettre à jour et se supprimer elle même. Pour l'industrie robotique, cette architecture cible un point faible documenté des VLA actuels, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure : leur dépendance à l'observation instantanée, qui les fragilise sur des tâches longues ou nécessitant de se souvenir d'une consigne donnée bien plus tôt. Beaucoup de démonstrations spectaculaires de robots humanoïdes reposent sur des séquences courtes et scriptées ; HiMe s'attaque explicitement à l'écart entre ces démonstrations et des tâches réelles multi-étapes, un angle mort souvent pointé par les intégrateurs. Si la séparation entre réactivité et raisonnement tient à l'échelle, elle offrirait une piste concrète pour concilier les deux sans sacrifier l'un pour l'autre. Le travail s'inscrit dans la lignée des recherches sur la mémoire des agents robotiques, qui cherchent à dépasser les architectures VLA à plat où toute l'information transite par une seule fenêtre de contexte. Les auteurs rapportent de meilleurs taux de réussite que ces références plates sur des tâches à horizon long, ainsi qu'une capacité inédite à corriger ses propres connaissances internes selon les préférences exprimées par un humain. Publié sans affiliation industrielle mise en avant, ce travail reste à ce stade une contribution académique : reste à voir si des laboratoires ou fournisseurs de VLA commerciaux comme Physical Intelligence, Nvidia ou Figure s'en inspireront pour des robots déployés en usine ou en entrepôt.

RechercheActu
1 source
CGFM-Nav : mémoire cognitive de graphe-champ pour la navigation incarnée multimodale et continue guidée sémantiquement
3arXiv cs.RO 

CGFM-Nav : mémoire cognitive de graphe-champ pour la navigation incarnée multimodale et continue guidée sémantiquement

Des chercheurs présentent CGFM-Nav, un framework de navigation robotique fondé sur un nouveau schéma de représentation d'environnement baptisé Cognitive Graph-Field Memory (CGFM), détaillé dans un article publié sur arXiv (référence 2608.29114v1) le 29 août 2026. CGFM combine une mémoire relationnelle explicite, sous forme de graphe de scène multimodal organisant objets, relations spatiales et observations visuelles, avec un champ sémantique continu qui guide l'exploration lorsqu'aucune correspondance fiable n'est trouvée dans le graphe. Le système repose sur un modèle vision-langage Qwen3-VL-8B comme backbone, complété par une sélection de sous-graphes pertinents pour la tâche, un raisonnement VLM et une boucle de vérification par feedback. Sur le benchmark GOAT-Bench, les auteurs rapportent une hausse du taux de succès global de 53,2% à 63,0%, et du score SPL (Success weighted by Path Length) de 30,0% à 39,6%, par rapport à une base équivalente sans CGFM. Ces chiffres sont qualifiés d'expérience préliminaire par les auteurs eux-mêmes, ce qui invite à la prudence avant toute généralisation. Pour l'industrie de la navigation robotique et de l'IA incarnée, ce travail s'attaque à un problème concret : les agents de navigation vision-langage (VLN) peinent historiquement à combiner mémoire sémantique persistante et exploration continue de zones inconnues, deux capacités habituellement traitées séparément. En prouvant qu'un même backbone VLM voit ses performances progresser significativement grâce à une meilleure structuration de la mémoire spatiale, l'étude appuie l'idée que les gains en navigation autonome ne viennent pas seulement de modèles plus gros, mais aussi de représentations d'environnement mieux conçues, un argument pertinent pour les intégrateurs travaillant sur des robots mobiles ou humanoïdes devant opérer en continu dans des environnements changeants. Ce travail s'inscrit dans la lignée des recherches en VLN qui cherchent à dépasser les limites des scene graphs statiques classiques, insuffisants pour guider l'exploration en l'absence de cible identifiée. Il se positionne dans un paysage où d'autres approches combinent déjà mémoire de graphe et modèles de fondation pour la navigation à long terme. L'article ne mentionne ni déploiement matériel, ni partenariat industriel, ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche évaluée en simulation sur GOAT-Bench, sans validation en conditions réelles.

RecherchePaper
1 source
Apprentissage auto-régressif forcé : vers un modèle du monde pour la navigation robotique à long horizon
4arXiv cs.RO 

Apprentissage auto-régressif forcé : vers un modèle du monde pour la navigation robotique à long horizon

Une équipe de chercheurs (arXiv:2605.31314, mai 2026) propose AR Forcing, une stratégie d'entraînement autorégressive pour les world models de navigation robotique basés sur la diffusion. Le problème adressé est un écart de distribution persistant : ces modèles sont entraînés avec une supervision parallèle, mais exécutent une inférence autorégressive au moment du planning de trajectoire. Cette asymétrie déstabilise les prédictions sur des horizons longs. AR Forcing l'attaque à la source en intégrant la fonction de perte diffusion standard dans la boucle autorégressive : à chaque étape, le modèle utilise ses propres prédictions pour mettre à jour le contexte et optimiser l'objectif de prédiction de bruit pas à pas. Les expériences ont été menées sur quatre jeux de données multi-domaines couvrant des environnements variés : RECON et SCAND (navigation urbaine et extérieure), HuRoN (interactions humain-robot) et TartanDrive (tout-terrain). L'intérêt pratique de cette approche tient à sa sobriété architecturale : AR Forcing ne requiert ni discriminateur supplémentaire, ni fonction de distribution-matching, et conserve le framework diffusion d'origine ainsi que son sampler. Pour les équipes développant des robots mobiles autonomes (AMR) ou des systèmes de navigation vision-only, cela signifie une intégration sans refonte de pipeline. Les résultats déclarés montrent une meilleure cohérence des images générées sur de longs horizons temporels et une amélioration de la précision des trajectoires prédites, y compris dans des environnements inconnus. Le bémol habituel s'applique ici : les métriques sont évaluées sur des datasets publics en conditions contrôlées, et le gap sim-to-real sur du hardware réel reste à démontrer. Les world models pour la navigation robotique constituent un axe de recherche actif, en lien direct avec les VLA (Vision-Language-Action models) et des travaux comme DreamerV3 ou UniSim. La dérive cumulative sur les horizons longs est précisément le verrou historique que AR Forcing tente de lever, là où les approches concurrentes recourent souvent à des mécanismes d'ancrage externes plus lourds. Le code source doit être publié prochainement selon les auteurs, ce qui permettra à la communauté de valider les résultats sur ses propres domaines applicatifs. Ce papier est un preprint arXiv non encore évalué par les pairs, sans financement industriel déclaré ni déploiement annoncé.

RecherchePaper
1 source