Aller au contenu principal
RecherchearXiv cs.RO 

OCC4M : mémoire 4D centrée objet pour le raisonnement spatiotemporel en manipulation à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

OCC4M, surnommé « Occam », est une mémoire 4D centrée sur les objets pour robots manipulateurs, présentée en septembre 2026 par ses auteurs (arXiv:2609.28798) pour les tâches longues nécessitant de raisonner sur un état absent du champ de vision actuel. Le système maintient des pistes persistantes dans un référentiel monde partagé et encode explicitement les relations temporelles, de mouvement et de contenance, par exemple pour localiser un objet sorti du champ de vision ou identifier le contenu d'un conteneur mélangé. Un modèle vision-langage interroge cette mémoire structurée pour désigner des cibles, ensuite traitées par un exécuteur bas niveau sans avoir besoin de l'historique complet des observations. Sur sept conditions de simulation et 350 épisodes, OCC4M obtient 96,6% de réussite mémoire et 88,9% de réussite de bout en bout, contre 54,6% et 57,7% pour FrameSamp, une référence utilisant Gemini 3.7 Flash avec l'historique brut complet et le même exécuteur. Après un changement de point de vue caméra, OCC4M conserve 100% et 98% de réussite, contre un score proche de zéro pour FrameSamp. Sur 20 épisodes réels avec un bras Franka et caméra fixe, OCC4M atteint 85% de précision mémoire contre 30% au maximum pour FrameSamp, et achève 45% des tâches complètes en deux étapes.

Ce résultat cible une faiblesse connue des architectures vision-langage-action actuelles, qui raisonnent souvent sur une fenêtre d'observations récentes ou sur tout l'historique brut, une approche coûteuse et peu fiable dès qu'une tâche s'étire dans le temps ou que le point de vue change, un cas fréquent en usine ou en logistique. En séparant la mémoire structurée de l'exécution bas niveau, OCC4M évite de faire porter tout le raisonnement long terme au modèle vision-langage, ce qui limite la dérive de contexte observée avec les approches par historique brut. L'effondrement quasi total de FrameSamp lors du changement de caméra illustre concrètement l'écart entre démonstrations en conditions contrôlées et robustesse réelle, un signal utile pour les intégrateurs qui évaluent des piles VLA pour des cellules robotiques à tâches longues et multi-étapes.

OCC4M s'inscrit dans la recherche sur la mémoire persistante pour la manipulation robotique, un axe distinct des architectures vision-langage-action généralistes qui gèrent surtout le contexte via une fenêtre d'observations glissante plutôt qu'une mémoire dédiée. Les auteurs situent leur contribution face à une référence bâtie sur Gemini 3.7 Flash de Google DeepMind, posant le débat entre mémoire structurée et simple élargissement du contexte des grands modèles multimodaux. Les tests, menés en simulation puis validés sur un bras Franka Emika réel, restent limités en échelle, avec seulement 20 épisodes physiques sur un seul type de bras, ce qui en fait une preuve de concept académique plutôt qu'un système prêt pour un déploiement industriel. Des vidéos qualitatives supplémentaires sont publiées sur occ4m-sup.github.io, sans calendrier annoncé de transfert vers un robot commercial.

À lire aussi

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
1arXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs. Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé. La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

RecherchePaper
1 source
GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques
2arXiv cs.RO 

GESTO : mémoire spatio-temporelle centrée sur l'humain pour le raisonnement dans des scènes dynamiques

Des chercheurs présentent GESTO (Grounded Event and Spatio-Temporal memOry), un système de mémoire spatio-temporelle destiné aux robots évoluant dans des environnements humains, décrit dans l'article arXiv:2608.10886v1 publié fin août 2026. GESTO combine un graphe de scène 4D persistant avec une hiérarchie à deux niveaux : les interactions homme-objet atomiques et les événements orientés vers un objectif. À partir d'un flux d'observation RGB-D, le système extrait automatiquement des interactions horodatées, les rattache à des entités de scène persistantes, les regroupe en événements, puis utilise le contexte de ces événements pour affiner les associations d'objets incertaines. Un agent d'appel d'outils sensible aux relations interroge ensuite cette mémoire pour un raisonnement centré sur l'activité. Sur les catégories texte, binaire et temporelle d'un benchmark existant, GESTO obtient des scores de 0,71, 0,75 et 0,70, se rapprochant d'une méthode disposant d'un ancrage événementiel et objet de référence (vérité terrain), tout en surpassant nettement la même architecture de raisonnement privée de ces informations. Sur 40 nouvelles requêtes Space2Event et Event2Space créées pour l'évaluation, il atteint 0,73 et 0,75. Cette publication comble un vide identifié entre deux familles d'approches : les graphes de scène 4D, qui conservent l'historique des objets et des lieux mais ignorent la structure des activités, et les représentations d'activités, généralement non ancrées dans une scène 3D persistante ou dépendantes de limites d'événements et d'associations d'objets fournies de l'extérieur. Pour l'industrie robotique, l'enjeu concerne les robots de service ou domestiques amenés à répondre à des questions rétrospectives du type qui a utilisé cet objet et dans quel but, plutôt que de simplement localiser des objets dans l'espace. Les scores rapportés, encore en dessous d'une référence disposant d'informations parfaites, situent GESTO comme une avancée de recherche crédible plutôt qu'un système prêt pour la production : le gain démontré est la capacité à approcher une performance oracle sans supervision externe sur les événements ou les objets. Les auteurs positionnent GESTO à l'intersection de deux littératures jusque-là disjointes, celle des graphes de scène 4D et celle des représentations d'activités humaines, en s'appuyant sur un flux RGB-D comme entrée unique. Leurs études d'ablation montrent que la structure hiérarchique des événements et l'affinage de l'ancrage sensible au contexte apportent des bénéfices complémentaires, chacun contribuant séparément à la performance globale. L'article ne mentionne aucun partenaire industriel, site de déploiement ni calendrier de commercialisation : il s'agit d'une contribution de recherche évaluée sur un benchmark existant enrichi de 40 requêtes conçues par les auteurs, sans acteur français ou européen cité. Les suites naturelles, non détaillées dans le résumé, porteraient sur l'extension à des scènes plus longues et des interactions plus variées, ainsi que sur une intégration à des piles complètes de planification robotique.

RecherchePaper
1 source
Vers un raisonnement procédural neuro-symbolique pour la manipulation VLA à long horizon
3arXiv cs.RO 

Vers un raisonnement procédural neuro-symbolique pour la manipulation VLA à long horizon

Un article publié sur arXiv (référence 2609.05369) début septembre 2026 présente un cadre neuro-symbolique destiné à corriger la fragilité des modèles vision-langage-action (VLA) sur les manipulations longues. Ces modèles exécutent bien des compétences courtes et isolées, mais peinent à maintenir un état de tâche persistant, à raisonner sur les dépendances entre actions et à gérer des décisions conditionnelles sur des séquences étendues. La méthode associe un contrôle VLA appris à des graphes de tâches explicites, qui encodent dépendances d'actions, transitions valides et conditions de branchement, ainsi qu'une mémoire procédurale multimodale qui suit l'étape active, les actions déjà accomplies, le contexte textuel et les preuves visuelles pertinentes. Des indices de regard humain, annotés en pseudo-regard sur des vidéos de téléopération vue robot, guident ensuite le fine-tuning et l'inférence du VLA. Deux domaines de test sont retenus: le débarrassage d'un espace de travail et la manipulation d'instruments chirurgicaux, évalués sur la sélection correcte d'objet et de destination, la complétion des sous-tâches et le taux de réussite complet de la procédure. Ce travail s'attaque à un angle mort du secteur: les modèles VLA de bout en bout, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, généralisent bien sur des tâches courtes grâce au volume de données d'entraînement, mais leur fiabilité chute nettement sur des procédures longues et structurées, un écart entre démonstration et usage réel rarement exposé publiquement. En réintroduisant une couche symbolique explicite plutôt qu'en misant uniquement sur davantage de données et de paramètres, l'étude suggère que la fiabilité recherchée par l'industrie et la chirurgie assistée passera par des architectures hybrides, pas seulement par le scaling des réseaux de neurones. C'est un signal utile pour les intégrateurs qui évaluent la maturité réelle des VLA au-delà des vidéos de démonstration soigneusement sélectionnées. Il s'agit d'une étude de recherche exploratoire, pas d'un produit déployé. Pour isoler l'effet du guidage visuel sur l'apprentissage de la politique, les auteurs contournent volontairement, dans cette première phase, le transfert de regard entre vue humaine et vue robot, une simplification méthodologique qu'ils assument eux-mêmes. Aucun partenaire industriel, site pilote ni calendrier de commercialisation n'est mentionné dans le document. Les auteurs indiquent vouloir étendre l'approche au transfert de regard inter-vues comme prochaine étape, afin de généraliser ce guidage à des démonstrations non téléopérées et de renforcer la robustesse du raisonnement procédural sur des tâches encore plus longues.

RecherchePaper
1 source
GORDON : récompenses par graphes centrées sur l'objet pour décomposer la manipulation à long horizon
4arXiv cs.RO 

GORDON : récompenses par graphes centrées sur l'objet pour décomposer la manipulation à long horizon

Une équipe de recherche décrit dans un article publié sur arXiv début août 2026 (2608.03753) GORDON, un système qui apprend des récompenses denses pour l'apprentissage par renforcement en manipulation robotique, à partir de simples vidéos de démonstration sans action associée. Chaque scène est convertie en graphe d'objets et de relations spatiales, qu'un réseau de neurones sur graphe, entraîné de façon auto-supervisée, projette dans un espace latent aligné sur la progression de la tâche, en isolant les objets pertinents du mouvement propre au bras robotique. La récompense correspond alors à la distance, dans cet espace, entre l'état courant et la configuration d'objectif démontrée. Sur sept tâches testées dans les bancs d'essai simulés MAGICAL et ManiSkill3, GORDON atteint un taux de réussite moyen de 74,4 % sur les tâches longues, soit environ 35 points de mieux que la meilleure base apprise et 25 points de mieux qu'une politique oracle. Ce résultat s'attaque à un goulot d'étranglement classique du RL robotique, la conception de la récompense pour des tâches longues et multi-étapes : les récompenses éparses donnent peu de signal, et celles apprises sur pixels bruts se révèlent fragiles aux variations d'arrière-plan ou de trajectoire. En représentant la scène par objets plutôt que par pixels, et en découvrant automatiquement les sous-tâches à partir du profil temporel de la récompense, sans annotation manuelle, GORDON réduit le travail d'ingénierie nécessaire pour décomposer une tâche complexe. C'est un frein connu pour les équipes qui entraînent des politiques sur des séquences d'assemblage ou de tri multi-étapes, un des obstacles à la généralisation des politiques apprises au-delà des tâches courtes. La méthode s'inscrit dans la lignée des travaux sur la récompense apprise par démonstration, qui cherchaient jusqu'ici un compromis entre richesse du signal et robustesse visuelle. Elle diffère des approches vision-langage-action comme Pi-0 ou GR00T N2, qui apprennent une politique de bout en bout : GORDON reste une brique de reward shaping et de décomposition de tâches, combinable en principe avec différents algorithmes de RL. Les résultats restent pour l'instant limités à deux bancs d'essai simulés, sans test sur robot physique ni transfert sim-to-real annoncé, ce qui reste l'étape suivante pour juger de la portée réelle de la méthode.

RecherchePaper
1 source