Aller au contenu principal
GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques
RecherchearXiv cs.RO 

GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent GESTO (Grounded Event and Spatio-Temporal memOry), un système de mémoire spatio-temporelle destiné aux robots évoluant dans des environnements humains, décrit dans l'article arXiv:2608.10886v1 publié fin août 2026. GESTO combine un graphe de scène 4D persistant avec une hiérarchie à deux niveaux : les interactions homme-objet atomiques et les événements orientés vers un objectif. À partir d'un flux d'observation RGB-D, le système extrait automatiquement des interactions horodatées, les rattache à des entités de scène persistantes, les regroupe en événements, puis utilise le contexte de ces événements pour affiner les associations d'objets incertaines. Un agent d'appel d'outils sensible aux relations interroge ensuite cette mémoire pour un raisonnement centré sur l'activité. Sur les catégories texte, binaire et temporelle d'un benchmark existant, GESTO obtient des scores de 0,71, 0,75 et 0,70, se rapprochant d'une méthode disposant d'un ancrage événementiel et objet de référence (vérité terrain), tout en surpassant nettement la même architecture de raisonnement privée de ces informations. Sur 40 nouvelles requêtes Space2Event et Event2Space créées pour l'évaluation, il atteint 0,73 et 0,75.

Cette publication comble un vide identifié entre deux familles d'approches : les graphes de scène 4D, qui conservent l'historique des objets et des lieux mais ignorent la structure des activités, et les représentations d'activités, généralement non ancrées dans une scène 3D persistante ou dépendantes de limites d'événements et d'associations d'objets fournies de l'extérieur. Pour l'industrie robotique, l'enjeu concerne les robots de service ou domestiques amenés à répondre à des questions rétrospectives du type qui a utilisé cet objet et dans quel but, plutôt que de simplement localiser des objets dans l'espace. Les scores rapportés, encore en dessous d'une référence disposant d'informations parfaites, situent GESTO comme une avancée de recherche crédible plutôt qu'un système prêt pour la production : le gain démontré est la capacité à approcher une performance oracle sans supervision externe sur les événements ou les objets.

Les auteurs positionnent GESTO à l'intersection de deux littératures jusque-là disjointes, celle des graphes de scène 4D et celle des représentations d'activités humaines, en s'appuyant sur un flux RGB-D comme entrée unique. Leurs études d'ablation montrent que la structure hiérarchique des événements et l'affinage de l'ancrage sensible au contexte apportent des bénéfices complémentaires, chacun contribuant séparément à la performance globale. L'article ne mentionne aucun partenaire industriel, site de déploiement ni calendrier de commercialisation : il s'agit d'une contribution de recherche évaluée sur un benchmark existant enrichi de 40 requêtes conçues par les auteurs, sans acteur français ou européen cité. Les suites naturelles, non détaillées dans le résumé, porteraient sur l'extension à des scènes plus longues et des interactions plus variées, ainsi que sur une intégration à des piles complètes de planification robotique.

Dans nos dossiers

À lire aussi

Persistance des connaissances spatio-temporelles : un graphe pour la mémoire de scène des robots dans les questions-réponses
1arXiv cs.RO 

Persistance des connaissances spatio-temporelles : un graphe pour la mémoire de scène des robots dans les questions-réponses

Des chercheurs publient VL-KnG, un framework open, sans entraînement supplémentaire ("training-free"), qui construit des graphes de connaissances spatio-temporels à partir de vidéo égocentrique monoculaire pour répondre à des questions embarquées (embodied question answering). Le système traite la vidéo par blocs (chunks) et maintient l'identité persistante des objets grâce à une association spatio-temporelle pilotée par un grand modèle de langage, baptisée STOA. Les réponses sont générées via une méthode nommée Graph-Enhanced Retrieval (GER), qui combine récupération de sous-graphes et ancrage visuel. Le framework a été évalué sur trois bancs d'essai : OpenEQA, NaVQA, et un nouveau benchmark introduit par les auteurs, WalkieKnowledge. Les auteurs annoncent une précision compétitive face aux VLM (vision-language models) de pointe, une latence de requête nettement plus faible, et un raisonnement explicable car ancré dans le graphe. Une démonstration sur robot réel est mentionnée, montrant une latence stable même quand l'historique d'observation s'allonge. Il s'agit de la troisième version (v3) d'un article déjà publié sur arXiv, donc d'un travail académique révisé, pas d'un produit commercial. L'intérêt principal ici n'est pas robotique au sens matériel, mais architectural : les VLM actuels n'ont pas de mémoire persistante, donc chaque nouvelle question oblige à retraiter toutes les frames vidéo échantillonnées, ce qui rend le coût de calcul proportionnel à la longueur de la vidéo. En découplant la latence de requête de la durée d'observation, VL-KnG répond directement à un vrai goulot d'étranglement pour les agents embarqués qui doivent accumuler de l'expérience sur de longues sessions, un problème central pour tout robot ou assistant devant raisonner sur des heures d'historique plutôt que sur un clip court. Si les chiffres de latence et de précision se confirment en dehors des bancs d'essai propriétaires des auteurs, cela offre une alternative crédible aux approches de reconstruction 3D lourdes, sans nécessiter cette reconstruction. Le papier s'inscrit dans une lignée de travaux sur la mémoire de scène persistante pour l'IA embarquée, en concurrence directe avec les approches de VLM "frontière" et les baselines à représentation persistante existantes, qu'il dit surpasser sur plusieurs configurations. Aucun acteur français ou européen n'est cité dans ce travail. Les prochaines étapes attendues concernent la généralisation à des environnements plus larges et l'intégration comme substrat mémoire pour des agents robotiques devant mettre à jour leurs connaissances en continu.

RecherchePaper
1 source
OCC4M : mémoire 4D centrée objet pour le raisonnement spatiotemporel en manipulation à long horizon
2arXiv cs.RO 

OCC4M : mémoire 4D centrée objet pour le raisonnement spatiotemporel en manipulation à long horizon

OCC4M, surnommé « Occam », est une mémoire 4D centrée sur les objets pour robots manipulateurs, présentée en septembre 2026 par ses auteurs (arXiv:2609.28798) pour les tâches longues nécessitant de raisonner sur un état absent du champ de vision actuel. Le système maintient des pistes persistantes dans un référentiel monde partagé et encode explicitement les relations temporelles, de mouvement et de contenance, par exemple pour localiser un objet sorti du champ de vision ou identifier le contenu d'un conteneur mélangé. Un modèle vision-langage interroge cette mémoire structurée pour désigner des cibles, ensuite traitées par un exécuteur bas niveau sans avoir besoin de l'historique complet des observations. Sur sept conditions de simulation et 350 épisodes, OCC4M obtient 96,6% de réussite mémoire et 88,9% de réussite de bout en bout, contre 54,6% et 57,7% pour FrameSamp, une référence utilisant Gemini 3.7 Flash avec l'historique brut complet et le même exécuteur. Après un changement de point de vue caméra, OCC4M conserve 100% et 98% de réussite, contre un score proche de zéro pour FrameSamp. Sur 20 épisodes réels avec un bras Franka et caméra fixe, OCC4M atteint 85% de précision mémoire contre 30% au maximum pour FrameSamp, et achève 45% des tâches complètes en deux étapes. Ce résultat cible une faiblesse connue des architectures vision-langage-action actuelles, qui raisonnent souvent sur une fenêtre d'observations récentes ou sur tout l'historique brut, une approche coûteuse et peu fiable dès qu'une tâche s'étire dans le temps ou que le point de vue change, un cas fréquent en usine ou en logistique. En séparant la mémoire structurée de l'exécution bas niveau, OCC4M évite de faire porter tout le raisonnement long terme au modèle vision-langage, ce qui limite la dérive de contexte observée avec les approches par historique brut. L'effondrement quasi total de FrameSamp lors du changement de caméra illustre concrètement l'écart entre démonstrations en conditions contrôlées et robustesse réelle, un signal utile pour les intégrateurs qui évaluent des piles VLA pour des cellules robotiques à tâches longues et multi-étapes. OCC4M s'inscrit dans la recherche sur la mémoire persistante pour la manipulation robotique, un axe distinct des architectures vision-langage-action généralistes qui gèrent surtout le contexte via une fenêtre d'observations glissante plutôt qu'une mémoire dédiée. Les auteurs situent leur contribution face à une référence bâtie sur Gemini 3.7 Flash de Google DeepMind, posant le débat entre mémoire structurée et simple élargissement du contexte des grands modèles multimodaux. Les tests, menés en simulation puis validés sur un bras Franka Emika réel, restent limités en échelle, avec seulement 20 épisodes physiques sur un seul type de bras, ce qui en fait une preuve de concept académique plutôt qu'un système prêt pour un déploiement industriel. Des vidéos qualitatives supplémentaires sont publiées sur occ4m-sup.github.io, sans calendrier annoncé de transfert vers un robot commercial.

RecherchePaper
1 source
RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique
3arXiv cs.RO 

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique

Des chercheurs présentent RoboStream, un framework sans entraînement (training-free) destiné à améliorer la planification robotique par modèles vision-langage (VLM) sur des tâches de manipulation à long horizon. Le système repose sur deux mécanismes : les STF-Tokens (Spatio-Temporal Fusion Tokens), qui lient les preuves visuelles à des attributs géométriques 3D pour ancrer durablement les objets dans la scène, et un graphe causal spatio-temporel (CSTG) qui enregistre les transitions d'état déclenchées par chaque action successive. Sur le benchmark RLBench en configuration longue durée, RoboStream atteint 90,5% de réussite. Sur des tâches réelles de construction de blocs, jugées plus exigeantes, il obtient 44,4%, contre seulement 11,1% pour les deux systèmes de référence SoFar et VoxPoser. Ce résultat cible un problème connu des planificateurs VLM actuels: ils traitent chaque étape comme une observation isolée, sans mémoire des actions précédentes ni de leur effet sur l'environnement. Concrètement, un objet temporairement caché par le bras du robot ou par un autre élément de la scène est purement et simplement "oublié", ce qui provoque des violations de précondition en cascade sur les étapes suivantes. Pour les intégrateurs et équipes de R&D en robotique manipulatrice, l'écart de performance rapporté sur les tâches réelles (44,4% contre 11,1%) illustre un problème plus large que la démonstration de laboratoire ne masque pas toujours: la difficulté à maintenir une cohérence géométrique et causale sur des séquences longues, bien au-delà de la simple perception image par image. Le fait que la méthode soit annoncée comme fonctionnant sans fine-tuning supplémentaire est notable pour un déploiement pratique, si les résultats se confirment au-delà du cadre contrôlé de l'étude. Ce travail s'inscrit dans la lignée des approches de raisonnement spatial pour la robotique, en s'opposant frontalement aux architectures VoxPoser et SoFar, utilisées ici comme lignes de base. Il s'agit pour l'instant d'une publication de recherche (version 2 mise à jour sur arXiv), sans indication de mise en production ou de partenariat industriel; les auteurs ne précisent pas de calendrier de suite ni d'intégration matérielle spécifique.

RechercheActu
1 source
HitMem : mémoire 3D temporelle hiérarchique et récupération multimodale contextuelle pour environnements dynamiques
4arXiv cs.RO 

HitMem : mémoire 3D temporelle hiérarchique et récupération multimodale contextuelle pour environnements dynamiques

Des chercheurs présentent HitMem, un framework de mémoire 3D hiérarchique et temporelle destiné aux agents robotiques évoluant dans des environnements dynamiques, décrit dans un article publié le 2 septembre 2026 sur arXiv (référence 2609.00950v1). Le système répond à une limite connue des mémoires de scène 3D existantes, conçues pour des mondes statiques : quand un objet est déplacé par une activité humaine ou un événement non observé, l'agent se retrouve en conflit entre sa mémoire et son observation, ce qui l'oblige soit à recalculer coûteusement la géométrie de la scène, soit à relancer une exploration globale inefficace. HitMem construit à la place un graphe topologique léger qui unifie information sémantique et spatiale et capture les relations de support entre objets, avec un mécanisme de décroissance temporelle qui régule dynamiquement l'activité de chaque souvenir pour limiter le poids des représentations obsolètes. Sa récupération d'information combine par défaut des filtres sémantiques, spatiaux et temporels, et bascule vers un processus de récupération en deux étapes dès qu'un déplacement d'objet est détecté, en croisant les trajectoires externes de l'agent avec des affinités de classe sémantiques pour cibler les zones candidates les plus probables. Les auteurs évaluent leur méthode sur un benchmark maison, Dyna-THOR, spécifiquement conçu pour ces scénarios dynamiques. Pour l'industrie robotique, ce travail cible un angle mort documenté des systèmes de navigation et de manipulation basés sur la perception continue : la plupart des architectures actuelles supposent un monde figé entre deux passages de l'agent, une hypothèse intenable en environnement humain réel (entrepôt partagé, domicile, atelier). Un mécanisme capable de localiser un objet déplacé sans recartographier toute la scène représente un gain direct de temps de cycle et de coût de calcul pour tout intégrateur travaillant sur des AMR ou des agents domestiques à mémoire persistante. Les résultats annoncés, une amélioration de la précision de relocalisation d'objets et une réduction du coût d'exploration, restent toutefois mesurés sur un benchmark propriétaire construit par les auteurs eux-mêmes, ce qui appelle une lecture prudente avant toute généralisation à des conditions de déploiement réel. HitMem s'inscrit dans la lignée des recherches sur la mémoire spatiale persistante pour agents incarnés, un axe distinct mais complémentaire des architectures VLA (vision-langage-action) comme Pi-0 ou GR00T N2, qui se concentrent sur la génération d'actions plutôt que sur la représentation du monde à long terme. Le nom Dyna-THOR suggère une extension du simulateur AI2-THOR, largement utilisé dans la recherche en navigation embarquée, adapté ici pour introduire des perturbations dynamiques dans l'environnement. À ce stade, il s'agit d'une publication de recherche et non d'un produit ou d'un déploiement commercial ; aucune date d'intégration dans un système robotique commercial ni de partenariat industriel n'est mentionné dans l'article.

RecherchePaper
1 source