Aller au contenu principal
RecherchearXiv cs.RO 

GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent GESTO (Grounded Event and Spatio-Temporal memOry), un système de mémoire spatio-temporelle destiné aux robots évoluant dans des environnements humains, décrit dans l'article arXiv:2608.10886v1 publié fin août 2026. GESTO combine un graphe de scène 4D persistant avec une hiérarchie à deux niveaux : les interactions homme-objet atomiques et les événements orientés vers un objectif. À partir d'un flux d'observation RGB-D, le système extrait automatiquement des interactions horodatées, les rattache à des entités de scène persistantes, les regroupe en événements, puis utilise le contexte de ces événements pour affiner les associations d'objets incertaines. Un agent d'appel d'outils sensible aux relations interroge ensuite cette mémoire pour un raisonnement centré sur l'activité. Sur les catégories texte, binaire et temporelle d'un benchmark existant, GESTO obtient des scores de 0,71, 0,75 et 0,70, se rapprochant d'une méthode disposant d'un ancrage événementiel et objet de référence (vérité terrain), tout en surpassant nettement la même architecture de raisonnement privée de ces informations. Sur 40 nouvelles requêtes Space2Event et Event2Space créées pour l'évaluation, il atteint 0,73 et 0,75.

Cette publication comble un vide identifié entre deux familles d'approches : les graphes de scène 4D, qui conservent l'historique des objets et des lieux mais ignorent la structure des activités, et les représentations d'activités, généralement non ancrées dans une scène 3D persistante ou dépendantes de limites d'événements et d'associations d'objets fournies de l'extérieur. Pour l'industrie robotique, l'enjeu concerne les robots de service ou domestiques amenés à répondre à des questions rétrospectives du type qui a utilisé cet objet et dans quel but, plutôt que de simplement localiser des objets dans l'espace. Les scores rapportés, encore en dessous d'une référence disposant d'informations parfaites, situent GESTO comme une avancée de recherche crédible plutôt qu'un système prêt pour la production : le gain démontré est la capacité à approcher une performance oracle sans supervision externe sur les événements ou les objets.

Les auteurs positionnent GESTO à l'intersection de deux littératures jusque-là disjointes, celle des graphes de scène 4D et celle des représentations d'activités humaines, en s'appuyant sur un flux RGB-D comme entrée unique. Leurs études d'ablation montrent que la structure hiérarchique des événements et l'affinage de l'ancrage sensible au contexte apportent des bénéfices complémentaires, chacun contribuant séparément à la performance globale. L'article ne mentionne aucun partenaire industriel, site de déploiement ni calendrier de commercialisation : il s'agit d'une contribution de recherche évaluée sur un benchmark existant enrichi de 40 requêtes conçues par les auteurs, sans acteur français ou européen cité. Les suites naturelles, non détaillées dans le résumé, porteraient sur l'extension à des scènes plus longues et des interactions plus variées, ainsi que sur une intégration à des piles complètes de planification robotique.

Dans nos dossiers

À lire aussi

Persistance des connaissances spatio-temporelles : un graphe pour la mémoire de scène des robots dans les questions-réponses
1arXiv cs.RO 

Persistance des connaissances spatio-temporelles : un graphe pour la mémoire de scène des robots dans les questions-réponses

Des chercheurs publient VL-KnG, un framework open, sans entraînement supplémentaire ("training-free"), qui construit des graphes de connaissances spatio-temporels à partir de vidéo égocentrique monoculaire pour répondre à des questions embarquées (embodied question answering). Le système traite la vidéo par blocs (chunks) et maintient l'identité persistante des objets grâce à une association spatio-temporelle pilotée par un grand modèle de langage, baptisée STOA. Les réponses sont générées via une méthode nommée Graph-Enhanced Retrieval (GER), qui combine récupération de sous-graphes et ancrage visuel. Le framework a été évalué sur trois bancs d'essai : OpenEQA, NaVQA, et un nouveau benchmark introduit par les auteurs, WalkieKnowledge. Les auteurs annoncent une précision compétitive face aux VLM (vision-language models) de pointe, une latence de requête nettement plus faible, et un raisonnement explicable car ancré dans le graphe. Une démonstration sur robot réel est mentionnée, montrant une latence stable même quand l'historique d'observation s'allonge. Il s'agit de la troisième version (v3) d'un article déjà publié sur arXiv, donc d'un travail académique révisé, pas d'un produit commercial. L'intérêt principal ici n'est pas robotique au sens matériel, mais architectural : les VLM actuels n'ont pas de mémoire persistante, donc chaque nouvelle question oblige à retraiter toutes les frames vidéo échantillonnées, ce qui rend le coût de calcul proportionnel à la longueur de la vidéo. En découplant la latence de requête de la durée d'observation, VL-KnG répond directement à un vrai goulot d'étranglement pour les agents embarqués qui doivent accumuler de l'expérience sur de longues sessions, un problème central pour tout robot ou assistant devant raisonner sur des heures d'historique plutôt que sur un clip court. Si les chiffres de latence et de précision se confirment en dehors des bancs d'essai propriétaires des auteurs, cela offre une alternative crédible aux approches de reconstruction 3D lourdes, sans nécessiter cette reconstruction. Le papier s'inscrit dans une lignée de travaux sur la mémoire de scène persistante pour l'IA embarquée, en concurrence directe avec les approches de VLM "frontière" et les baselines à représentation persistante existantes, qu'il dit surpasser sur plusieurs configurations. Aucun acteur français ou européen n'est cité dans ce travail. Les prochaines étapes attendues concernent la généralisation à des environnements plus larges et l'intégration comme substrat mémoire pour des agents robotiques devant mettre à jour leurs connaissances en continu.

RecherchePaper
1 source
RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique
2arXiv cs.RO 

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique

Des chercheurs présentent RoboStream, un framework sans entraînement (training-free) destiné à améliorer la planification robotique par modèles vision-langage (VLM) sur des tâches de manipulation à long horizon. Le système repose sur deux mécanismes : les STF-Tokens (Spatio-Temporal Fusion Tokens), qui lient les preuves visuelles à des attributs géométriques 3D pour ancrer durablement les objets dans la scène, et un graphe causal spatio-temporel (CSTG) qui enregistre les transitions d'état déclenchées par chaque action successive. Sur le benchmark RLBench en configuration longue durée, RoboStream atteint 90,5% de réussite. Sur des tâches réelles de construction de blocs, jugées plus exigeantes, il obtient 44,4%, contre seulement 11,1% pour les deux systèmes de référence SoFar et VoxPoser. Ce résultat cible un problème connu des planificateurs VLM actuels: ils traitent chaque étape comme une observation isolée, sans mémoire des actions précédentes ni de leur effet sur l'environnement. Concrètement, un objet temporairement caché par le bras du robot ou par un autre élément de la scène est purement et simplement "oublié", ce qui provoque des violations de précondition en cascade sur les étapes suivantes. Pour les intégrateurs et équipes de R&D en robotique manipulatrice, l'écart de performance rapporté sur les tâches réelles (44,4% contre 11,1%) illustre un problème plus large que la démonstration de laboratoire ne masque pas toujours: la difficulté à maintenir une cohérence géométrique et causale sur des séquences longues, bien au-delà de la simple perception image par image. Le fait que la méthode soit annoncée comme fonctionnant sans fine-tuning supplémentaire est notable pour un déploiement pratique, si les résultats se confirment au-delà du cadre contrôlé de l'étude. Ce travail s'inscrit dans la lignée des approches de raisonnement spatial pour la robotique, en s'opposant frontalement aux architectures VoxPoser et SoFar, utilisées ici comme lignes de base. Il s'agit pour l'instant d'une publication de recherche (version 2 mise à jour sur arXiv), sans indication de mise en production ou de partenariat industriel; les auteurs ne précisent pas de calendrier de suite ni d'intégration matérielle spécifique.

RechercheActu
1 source
RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
3arXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs. Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé. La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

RecherchePaper
1 source
Agilité spatiotemporelle : apprentissage par renforcement contraint dans le temps pour l'interception quadrupède dynamique guidée par vision
4arXiv cs.RO 

Agilité spatiotemporelle : apprentissage par renforcement contraint dans le temps pour l'interception quadrupède dynamique guidée par vision

Une équipe de recherche a publie début aout 2026 sur arXiv, sous la référence 2608.06907, un système de capture de balle pour robot quadrupède, pense comme benchmark d'agilité spatiotemporelle. Le dispositif associe un module de vision multi-camera, qui prédit point d'atterrissage et temps de vol de la balle, a une politique de locomotion par renforcement conditionnée directement par la position et le temps cibles, plutôt que par des commandes de vitesse. Teste en boucle fermée, ce système bat une politique de référence a suivi de vitesse, avec un taux de réussite supérieur pour des balles atterrissant a moins de 2 mètres et un temps de vol de 0,8 a 1,2 seconde, et un écart simulation-réel réduit. Ce travail s'attaque a une limite connue de la locomotion quadrupède actuelle : piloter par commandes de vitesse rend difficile l'atteinte précise d'une cible dans une fenêtre temporelle stricte. En prédisant explicitement la position et l'instant futurs de la cible plutôt qu'en réagissant en temps réel, la méthode compense la latence des capteurs et du traitement d'image, un enjeu central pour toute interaction robotique dynamique comme attraper un objet en chute ou éviter un obstacle mobile. Pour les concepteurs de contrôleurs, le résultat suggère qu'un conditionnement direct par position et temps peut surpasser les commandes de vitesse intermédiaires, mais reste un résultat de laboratoire, sans partenaire industriel ni calendrier de commercialisation annonces. Le travail s'inscrit dans un mouvement plus large de la recherche en robotique quadrupède, qui cherche a dépasser la marche stable pour aller vers des interactions dynamiques et précises, un axe peu couvert par les politiques de contrôle actuelles, optimisées surtout pour la robustesse du déplacement. L'article revendique une double contribution, algorithmique avec la politique conditionnée par cible spatiotemporelle, et système avec l'intégration bout en bout de la perception, de la prédiction de trajectoire et du contrôle sim-to-real, sans qu'aucune entreprise ni institution ne soit nommée, signe d'un travail encore académique. Les suites logiques évoquées porteraient sur l'extension du benchmark a des cibles plus variées et rapides, ainsi que sur une réduction de la latence globale avant tout passage a l'échelle hors du cadre expérimental teste.

RecherchePaper
1 source