Aller au contenu principal
RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
RecherchearXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs.

Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé.

La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

Dans nos dossiers

À lire aussi

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique
1arXiv cs.RO 

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique

Des chercheurs présentent RoboStream, un framework sans entraînement (training-free) destiné à améliorer la planification robotique par modèles vision-langage (VLM) sur des tâches de manipulation à long horizon. Le système repose sur deux mécanismes : les STF-Tokens (Spatio-Temporal Fusion Tokens), qui lient les preuves visuelles à des attributs géométriques 3D pour ancrer durablement les objets dans la scène, et un graphe causal spatio-temporel (CSTG) qui enregistre les transitions d'état déclenchées par chaque action successive. Sur le benchmark RLBench en configuration longue durée, RoboStream atteint 90,5% de réussite. Sur des tâches réelles de construction de blocs, jugées plus exigeantes, il obtient 44,4%, contre seulement 11,1% pour les deux systèmes de référence SoFar et VoxPoser. Ce résultat cible un problème connu des planificateurs VLM actuels: ils traitent chaque étape comme une observation isolée, sans mémoire des actions précédentes ni de leur effet sur l'environnement. Concrètement, un objet temporairement caché par le bras du robot ou par un autre élément de la scène est purement et simplement "oublié", ce qui provoque des violations de précondition en cascade sur les étapes suivantes. Pour les intégrateurs et équipes de R&D en robotique manipulatrice, l'écart de performance rapporté sur les tâches réelles (44,4% contre 11,1%) illustre un problème plus large que la démonstration de laboratoire ne masque pas toujours: la difficulté à maintenir une cohérence géométrique et causale sur des séquences longues, bien au-delà de la simple perception image par image. Le fait que la méthode soit annoncée comme fonctionnant sans fine-tuning supplémentaire est notable pour un déploiement pratique, si les résultats se confirment au-delà du cadre contrôlé de l'étude. Ce travail s'inscrit dans la lignée des approches de raisonnement spatial pour la robotique, en s'opposant frontalement aux architectures VoxPoser et SoFar, utilisées ici comme lignes de base. Il s'agit pour l'instant d'une publication de recherche (version 2 mise à jour sur arXiv), sans indication de mise en production ou de partenariat industriel; les auteurs ne précisent pas de calendrier de suite ni d'intégration matérielle spécifique.

RechercheActu
1 source
LookStep : navigation vision-langage efficace grâce à l'anticipation linguistique et une mémoire événementielle
2arXiv cs.RO 

LookStep : navigation vision-langage efficace grâce à l'anticipation linguistique et une mémoire événementielle

Des chercheurs ont publié LookStep, un framework de navigation vision-langage (VLN) qui vise à réduire les besoins en calcul et en données d'entraînement des agents suivant des instructions en langage naturel dans des environnements inconnus. Décrit dans un article déposé sur arXiv (identifiant 2609.02350v2, republication croisée), le code et le modèle sont disponibles en open source sur GitHub, sous le compte kunyang-YU. Le système combine deux mécanismes : une modélisation de futurs états centrée sur le langage, qui attribue à chaque action candidate une étiquette textuelle décrivant la progression de la navigation et l'état futur attendu, et une mémoire glissante événementielle bornée, qui décide de façon autonome quelles observations conserver en leur assignant un rôle sémantique. Sur le benchmark de référence R2R-CE Val-Unseen, LookStep atteint un taux de réussite de 49,7 %, supérieur aux méthodes existantes entraînées dans les mêmes conditions, avec une meilleure efficacité mémoire et moins de données utilisées. Ce résultat cible un point de friction connu de la navigation robotique par instructions : la plupart des méthodes récentes, portées par les grands modèles multimodaux (MLLM), reposent sur une prédiction action par action supervisée uniquement sur l'action experte, ce qui exige d'énormes volumes de données annotées. Elles s'appuient aussi sur des cartes cognitives, un historique complet d'images accumulées ou des outils 3D externes pour maintenir un état du monde, au prix d'une charge mémoire et calculatoire élevée. En montrant qu'un agent peut égaler, voire dépasser, ces méthodes avec une mémoire bornée et moins de données d'entraînement, LookStep suggère que l'efficacité ressource n'est pas nécessairement sacrifiée à la performance, un enjeu direct pour tout intégrateur visant un déploiement embarqué sur robot mobile ou drone plutôt qu'un calcul déporté vers le cloud. Le gain reste toutefois mesuré sur un seul benchmark simulé, sans validation rapportée sur robot physique en conditions réelles. L'approche s'inscrit dans la lignée des travaux récents exploitant les MLLM pour la navigation embarquée, un domaine où le paradigme dominant reste la prédiction du prochain pas d'action à partir des instructions et des observations visuelles. L'abstract ne mentionne aucun partenariat industriel, ni acteur commercial concurrent, ni calendrier de déploiement : il s'agit à ce stade d'un travail de recherche académique validé sur le benchmark VLN-CE, et non d'un produit commercialisé ou d'un pilote annoncé. La publication du code et du modèle en open source doit permettre à la communauté de reproduire les résultats et de comparer LookStep aux approches concurrentes de navigation vision-langage sur les mêmes jeux de données.

RecherchePaper
1 source
GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques
3arXiv cs.RO 

GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques

Des chercheurs présentent GESTO (Grounded Event and Spatio-Temporal memOry), un système de mémoire spatio-temporelle destiné aux robots évoluant dans des environnements humains, décrit dans l'article arXiv:2608.10886v1 publié fin août 2026. GESTO combine un graphe de scène 4D persistant avec une hiérarchie à deux niveaux : les interactions homme-objet atomiques et les événements orientés vers un objectif. À partir d'un flux d'observation RGB-D, le système extrait automatiquement des interactions horodatées, les rattache à des entités de scène persistantes, les regroupe en événements, puis utilise le contexte de ces événements pour affiner les associations d'objets incertaines. Un agent d'appel d'outils sensible aux relations interroge ensuite cette mémoire pour un raisonnement centré sur l'activité. Sur les catégories texte, binaire et temporelle d'un benchmark existant, GESTO obtient des scores de 0,71, 0,75 et 0,70, se rapprochant d'une méthode disposant d'un ancrage événementiel et objet de référence (vérité terrain), tout en surpassant nettement la même architecture de raisonnement privée de ces informations. Sur 40 nouvelles requêtes Space2Event et Event2Space créées pour l'évaluation, il atteint 0,73 et 0,75. Cette publication comble un vide identifié entre deux familles d'approches : les graphes de scène 4D, qui conservent l'historique des objets et des lieux mais ignorent la structure des activités, et les représentations d'activités, généralement non ancrées dans une scène 3D persistante ou dépendantes de limites d'événements et d'associations d'objets fournies de l'extérieur. Pour l'industrie robotique, l'enjeu concerne les robots de service ou domestiques amenés à répondre à des questions rétrospectives du type qui a utilisé cet objet et dans quel but, plutôt que de simplement localiser des objets dans l'espace. Les scores rapportés, encore en dessous d'une référence disposant d'informations parfaites, situent GESTO comme une avancée de recherche crédible plutôt qu'un système prêt pour la production : le gain démontré est la capacité à approcher une performance oracle sans supervision externe sur les événements ou les objets. Les auteurs positionnent GESTO à l'intersection de deux littératures jusque-là disjointes, celle des graphes de scène 4D et celle des représentations d'activités humaines, en s'appuyant sur un flux RGB-D comme entrée unique. Leurs études d'ablation montrent que la structure hiérarchique des événements et l'affinage de l'ancrage sensible au contexte apportent des bénéfices complémentaires, chacun contribuant séparément à la performance globale. L'article ne mentionne aucun partenaire industriel, site de déploiement ni calendrier de commercialisation : il s'agit d'une contribution de recherche évaluée sur un benchmark existant enrichi de 40 requêtes conçues par les auteurs, sans acteur français ou européen cité. Les suites naturelles, non détaillées dans le résumé, porteraient sur l'extension à des scènes plus longues et des interactions plus variées, ainsi que sur une intégration à des piles complètes de planification robotique.

RecherchePaper
1 source
GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives
4arXiv cs.RO 

GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives

Un nouveau papier de recherche publié le 14 septembre 2026 sur arXiv (référence 2609.14561, soumission inédite, non encore relue par les pairs) présente GLAM, un modèle du monde latent conditionné par un objectif et entraîné sur une mémoire spatiotemporelle globale, ainsi que GLAM NAV, le système de navigation complet construit autour de ce modèle. À partir de tokens de carte historiques, d'un objectif de navigation et de la pose courante du robot, GLAM prédit conjointement les représentations futures de la carte et les latents de points de passage centrés sur le robot, dans un espace de représentation partagé. Le modèle suit un paradigme de prédiction latente de type JEPA, opère directement sur des tokens latents au niveau de la carte plutôt que sur une reconstruction d'images RGB, et s'appuie sur un encodeur-décodeur de waypoints pré-entraîné pour superviser et décoder les plans de navigation. Les données d'entraînement proviennent de trajectoires expertes de la tâche ObjectNav rejouées dans le simulateur Habitat sur les scènes HM3D v0.2, découpées en échantillons de prédiction à plusieurs échelles temporelles. Sur un sous-ensemble contrôlé du benchmark HM3D-ObjectNav, GLAM NAV dépasse une base de référence BSC-Nav reproduite, à la fois en taux de succès et en SPL (succès pondéré par la longueur du chemin). L'intérêt pour la robotique mobile tient à l'approche : en prédisant l'évolution de la mémoire spatiale et l'intention de navigation dans un même espace latent, sans reconstruire des images pixel par pixel, GLAM illustre la piste des modèles du monde compacts appliqués à l'exploration active et à la navigation sémantique, plutôt qu'aux seules politiques d'action de type VLA. Pour les intégrateurs travaillant sur des robots autonomes en environnement inconnu, ce type d'approche promet une planification moins coûteuse en calcul que les pipelines classiques de reconstruction 3D. Le résultat reste toutefois circonscrit à un sous-ensemble contrôlé en simulation, sans validation sur robot réel ni déploiement annoncé, ce qui limite pour l'instant la portée de la comparaison à BSC-Nav. Le travail s'inscrit dans la lignée des architectures JEPA (prédiction dans l'espace latent plutôt que reconstruction pixel) appliquées cette fois à la navigation robotique, en s'appuyant sur l'écosystème de simulation Habitat et le jeu de scènes HM3D largement utilisés par la communauté ObjectNav. Le résumé ne précise ni les auteurs ni leur institution, ni de calendrier de validation matérielle ; il s'agit à ce stade d'une contribution académique en amont de toute intégration industrielle.

RecherchePaper
1 source