GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques
Des chercheurs présentent GESTO (Grounded Event and Spatio-Temporal memOry), un système de mémoire spatio-temporelle destiné aux robots évoluant dans des environnements humains, décrit dans l'article arXiv:2608.10886v1 publié fin août 2026. GESTO combine un graphe de scène 4D persistant avec une hiérarchie à deux niveaux : les interactions homme-objet atomiques et les événements orientés vers un objectif. À partir d'un flux d'observation RGB-D, le système extrait automatiquement des interactions horodatées, les rattache à des entités de scène persistantes, les regroupe en événements, puis utilise le contexte de ces événements pour affiner les associations d'objets incertaines. Un agent d'appel d'outils sensible aux relations interroge ensuite cette mémoire pour un raisonnement centré sur l'activité. Sur les catégories texte, binaire et temporelle d'un benchmark existant, GESTO obtient des scores de 0,71, 0,75 et 0,70, se rapprochant d'une méthode disposant d'un ancrage événementiel et objet de référence (vérité terrain), tout en surpassant nettement la même architecture de raisonnement privée de ces informations. Sur 40 nouvelles requêtes Space2Event et Event2Space créées pour l'évaluation, il atteint 0,73 et 0,75.
Cette publication comble un vide identifié entre deux familles d'approches : les graphes de scène 4D, qui conservent l'historique des objets et des lieux mais ignorent la structure des activités, et les représentations d'activités, généralement non ancrées dans une scène 3D persistante ou dépendantes de limites d'événements et d'associations d'objets fournies de l'extérieur. Pour l'industrie robotique, l'enjeu concerne les robots de service ou domestiques amenés à répondre à des questions rétrospectives du type qui a utilisé cet objet et dans quel but, plutôt que de simplement localiser des objets dans l'espace. Les scores rapportés, encore en dessous d'une référence disposant d'informations parfaites, situent GESTO comme une avancée de recherche crédible plutôt qu'un système prêt pour la production : le gain démontré est la capacité à approcher une performance oracle sans supervision externe sur les événements ou les objets.
Les auteurs positionnent GESTO à l'intersection de deux littératures jusque-là disjointes, celle des graphes de scène 4D et celle des représentations d'activités humaines, en s'appuyant sur un flux RGB-D comme entrée unique. Leurs études d'ablation montrent que la structure hiérarchique des événements et l'affinage de l'ancrage sensible au contexte apportent des bénéfices complémentaires, chacun contribuant séparément à la performance globale. L'article ne mentionne aucun partenaire industriel, site de déploiement ni calendrier de commercialisation : il s'agit d'une contribution de recherche évaluée sur un benchmark existant enrichi de 40 requêtes conçues par les auteurs, sans acteur français ou européen cité. Les suites naturelles, non détaillées dans le résumé, porteraient sur l'extension à des scènes plus longues et des interactions plus variées, ainsi que sur une intégration à des piles complètes de planification robotique.
Dans nos dossiers




