Aller au contenu principal
RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
RecherchearXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs.

Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé.

La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

Dans nos dossiers

À lire aussi

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique
1arXiv cs.RO 

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique

Des chercheurs présentent RoboStream, un framework sans entraînement (training-free) destiné à améliorer la planification robotique par modèles vision-langage (VLM) sur des tâches de manipulation à long horizon. Le système repose sur deux mécanismes : les STF-Tokens (Spatio-Temporal Fusion Tokens), qui lient les preuves visuelles à des attributs géométriques 3D pour ancrer durablement les objets dans la scène, et un graphe causal spatio-temporel (CSTG) qui enregistre les transitions d'état déclenchées par chaque action successive. Sur le benchmark RLBench en configuration longue durée, RoboStream atteint 90,5% de réussite. Sur des tâches réelles de construction de blocs, jugées plus exigeantes, il obtient 44,4%, contre seulement 11,1% pour les deux systèmes de référence SoFar et VoxPoser. Ce résultat cible un problème connu des planificateurs VLM actuels: ils traitent chaque étape comme une observation isolée, sans mémoire des actions précédentes ni de leur effet sur l'environnement. Concrètement, un objet temporairement caché par le bras du robot ou par un autre élément de la scène est purement et simplement "oublié", ce qui provoque des violations de précondition en cascade sur les étapes suivantes. Pour les intégrateurs et équipes de R&D en robotique manipulatrice, l'écart de performance rapporté sur les tâches réelles (44,4% contre 11,1%) illustre un problème plus large que la démonstration de laboratoire ne masque pas toujours: la difficulté à maintenir une cohérence géométrique et causale sur des séquences longues, bien au-delà de la simple perception image par image. Le fait que la méthode soit annoncée comme fonctionnant sans fine-tuning supplémentaire est notable pour un déploiement pratique, si les résultats se confirment au-delà du cadre contrôlé de l'étude. Ce travail s'inscrit dans la lignée des approches de raisonnement spatial pour la robotique, en s'opposant frontalement aux architectures VoxPoser et SoFar, utilisées ici comme lignes de base. Il s'agit pour l'instant d'une publication de recherche (version 2 mise à jour sur arXiv), sans indication de mise en production ou de partenariat industriel; les auteurs ne précisent pas de calendrier de suite ni d'intégration matérielle spécifique.

RechercheActu
1 source
VL-LN Bench : vers une navigation orientée objectifs à long horizon avec dialogues actifs
2arXiv cs.RO 

VL-LN Bench : vers une navigation orientée objectifs à long horizon avec dialogues actifs

Une équipe de recherche propose Interactive Instance Goal Navigation (IIGN), une nouvelle tâche de navigation robotique où l'agent peut librement interroger un oracle en langage naturel pendant sa recherche d'un objet spécifique, plutôt que de recevoir une instruction figée et non ambiguë comme c'est le cas dans la navigation par instruction classique. Pour évaluer cette capacité, les chercheurs publient VL-LN Bench, un benchmark construit autour d'un pipeline de collecte de données automatisé ayant généré plus de 41 000 trajectoires de dialogue longues et augmentées, destinées à l'entraînement des modèles. Le benchmark inclut aussi un protocole d'évaluation automatique couplé à un oracle dédié capable de répondre aux questions de l'agent en cours de mission. Les expériences menées identifient deux verrous techniques majeurs : l'exploration sur de longs horizons temporels et la capacité à relier finement une information textuelle à la bonne instance parmi des distracteurs de même catégorie visuelle. Ce travail éclaire un point sensible pour l'industrie de la robotique embarquée : la plupart des agents de navigation actuels, y compris les modèles vision-langage-action (VLA) les plus avancés, fonctionnent bien sur des instructions bien formées mais s'effondrent dès que la consigne devient ambiguë, ce qui est pourtant la norme dans un usage réel en entrepôt, en intérieur domestique ou en environnement industriel non structuré. Les résultats montrent que le dialogue actif atténue partiellement ces limites, mais que l'écart avec la performance humaine reste important, ce qui tempère les annonces de robots capables de "comprendre" des instructions naturelles complexes sans supervision. IIGN s'inscrit dans la continuité de l'Instance Goal Navigation (IGN), une tâche déjà établie dans la littérature d'IA embarquée, en y ajoutant la dimension conversationnelle qui manquait pour rapprocher les benchmarks académiques des conditions réelles de déploiement. Les auteurs valident également, via des ablations, l'intérêt de leur pipeline de génération de données et montrent que leur oracle automatisé peut se substituer à une supervision humaine à moindre coût, ouvrant la voie à un entraînement à plus grande échelle de ces agents dialogiques.

RecherchePaper
1 source
Raisonner en texte et en images : traces de raisonnement vision-langage entrelacées pour la manipulation robotique à long horizon
3arXiv cs.RO 

Raisonner en texte et en images : traces de raisonnement vision-langage entrelacées pour la manipulation robotique à long horizon

Des chercheurs ont publié sur arXiv (arXiv:2605.00438) un cadre de politique robotique appelé IVLR (Interleaved Vision-Language Reasoning), conçu pour la manipulation à horizon long. Le coeur du système est une représentation intermédiaire explicite, la "trace", qui alterne des sous-objectifs textuels avec des images-clés visuelles sur l'ensemble de la séquence de tâche. À l'inférence, un transformateur multimodal natif génère cette trace globale à partir de l'observation initiale et de l'instruction, la met en cache, puis conditionne un décodeur d'actions en boucle fermée. Sur le benchmark simulé LIBERO, IVLR atteint 95,5 % de taux de succès moyen, dont 92,4 % sur LIBERO-Long, et 59,4 % sur SimplerEnv-WidowX. L'absence de telles traces dans les jeux de données robotiques existants est contournée par une pseudo-supervision construite en segmentant temporellement des démonstrations et en les annotant automatiquement via un modèle vision-langage. Les ablations quantifient clairement la valeur de chaque modalité : sans trace, LIBERO-Long chute à 37,7 % ; une trace texte seule atteint 62,0 %, une trace visuelle seule 68,4 %, tandis que la trace entrelacée texte-image monte à 92,4 %. L'écart de 30 points entre la combinaison et les modalités isolées démontre que le raisonnement causal (texte) et les contraintes géométriques (image) sont complémentaires, pas substituables. C'est une contribution directe au débat sur la planification explicite versus latente dans les politiques VLA (Vision-Language-Action) : masquer la planification dans des états latents, comme le font la majorité des architectures actuelles, laisse une performance substantielle sur la table. IVLR s'inscrit dans un courant de politiques VLA à planification explicite, en concurrence avec des approches comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui intègrent également des capacités de raisonnement multimodal. La méthode de pseudo-supervision est potentiellement impactante pour les équipes académiques : elle permet de réutiliser des datasets existants sans annotations humaines supplémentaires, abaissant le coût d'entrée à la recherche sur les longues séquences. Les tests de robustesse indiquent une dégradation modérée face aux perturbations d'exécution et aux traces partiellement masquées, mais les auteurs reconnaissent une limite claire : lorsque le plan global est incorrect ou obsolète, le système reste fragile. La prochaine étape logique est la mise à jour dynamique de la trace en cours d'exécution, et la validation sur robots physiques hors simulation.

UELes laboratoires académiques européens (INRIA, CEA-List) travaillant sur les politiques VLA pourraient directement réutiliser la méthode de pseudo-supervision pour annoter leurs datasets existants sans coût humain supplémentaire.

RechercheOpinion
1 source
MIRTH : raisonnement par information mutuelle avec pôles temporels pour agents vision-langage-action
4arXiv cs.RO 

MIRTH : raisonnement par information mutuelle avec pôles temporels pour agents vision-langage-action

Une équipe de recherche présente MIRTH (Mutual-Information Reasoning with Temporal Hubs), un framework qui vient se greffer sur un modèle VLA (vision-language-action) préentraîné pour améliorer le contrôle robotique. Le système ajoute trois briques techniques : des "hubs" de mémoire temporelle à double échelle qui compressent l'historique long terme de la scène et les tendances de mouvement court terme en embeddings compacts, des tokens de raisonnement latent optimisés via un objectif d'information mutuelle pour aligner le contexte multimodal avec les trajectoires d'action, et un schéma de décodage d'action parallèle qui remplace la génération autorégressive classique par une prédiction vectorielle simultanée pour accélérer le débit de contrôle. Les auteurs annoncent des résultats state-of-the-art sur le benchmark de simulation LIBERO ainsi que sur une plateforme réelle LeRobot, avec des capacités émergentes de récupération d'erreur. Code et jeux de données sont publiés sur GitHub (kiva12138/mirth). L'enjeu ciblé est bien identifié dans la littérature robotique actuelle : les architectures VLA à trame unique souffrent d'une myopie temporelle qui ignore la dynamique passée de la scène, d'un fossé de raisonnement entre instructions de haut niveau et commandes moteur de bas niveau, et d'une latence d'inférence due au décodage scalaire autorégressif. Ces limites freinent le déploiement de modèles VLA génériques face aux systèmes spécialisés dans l'industrie. À noter toutefois : la validation "monde réel" repose sur LeRobot, une plateforme robotique low-cost destinée à la recherche, loin des contraintes d'un bras industriel ou d'un humanoïde en usine ; les gains restent donc à confirmer à plus grande échelle avant toute traduction en déploiement B2B. MIRTH s'inscrit dans la lignée des travaux type RT-2, Pi-0 ou GR00T N2, qui cherchent à transférer les connaissances sémantiques du web vers le contrôle physique. La contribution ici est ciblée sur la mémoire temporelle et l'efficacité du décodage plutôt que sur l'échelle des données d'entraînement, une direction complémentaire aux approches des grands laboratoires. La publication du code sur GitHub ouvre la voie à des réplications indépendantes, étape nécessaire pour évaluer la robustesse réelle de ces gains annoncés.

RechercheOpinion
1 source