Aller au contenu principal
RecherchearXiv cs.RO 

ECoMEM : une mémoire à concepts explicites pour le contrôle de robots dépendant de la mémoire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ECoMEM (Explicit Concept Memory), une architecture de mémoire pour les politiques robotiques de type vision-langage-action (VLA), publiée sur arXiv en octobre 2026. Le système remplace l'historique brut ou la mémoire implicite apprise par une bibliothèque réutilisable de « concepts » ancrés dans les observations, par exemple la position d'un objet disparu du champ de vision, ce qu'un humain a démontré plus tôt, ou les étapes déjà accomplies d'une tâche. Un module Writer, fondé sur des preuves observées, sélectionne et met à jour ces enregistrements. Un module Reader, appris, les convertit en tokens de mémoire qui conditionnent directement la VLA. Sur le benchmark RoboMME (16 tâches), ECoMEM arrive en tête des politiques évaluées sur 15 tâches. Sur deux nouvelles tâches en robot réel, la même bibliothèque de concepts est soit réutilisée telle quelle, soit complétée par un seul nouveau concept. Le taux de succès atteint 86,1 %, contre 8,6 % pour une VLA sans mémoire. Les auteurs ne précisent pas, dans le résumé, la plateforme robotique, le nombre d'essais ni la VLA de base utilisée.

Ce travail s'attaque à une faiblesse structurelle des VLA actuelles : elles décident à partir de l'observation courante et échouent dès que l'information utile n'est plus visible. Or les tâches à long horizon rencontrées en logistique, en assemblage ou en service (retrouver une pièce rangée hors champ, reprendre une séquence interrompue, répéter une démonstration) en dépendent. L'écart 86,1 % contre 8,6 % montre surtout que le cas sans mémoire est un plancher quasi nul sur ces tâches, ce qui est attendu par construction. La comparaison la plus utile serait celle avec les mémoires à historique long ou implicites. Pour les intégrateurs, l'intérêt tient à l'extensibilité annoncée : ajouter un concept plutôt que réentraîner une politique entière réduirait le coût d'adaptation à un nouveau poste. Il tient aussi à l'inspectabilité, car une mémoire explicite peut être lue et débogguée, ce qui compte pour la validation en environnement industriel. Ces affirmations restent à confirmer sur un nombre de tâches réelles réduit à deux, avec une définition des concepts qui reste conçue par des humains.

Le résultat s'inscrit dans un débat de fond sur la mémoire des modèles robotiques. Les approches dominantes allongent le contexte d'images passées ou apprennent une mémoire latente à partir des seules trajectoires observation-action, ce que les auteurs jugent insuffisant puisque la supervision d'action n'indique pas quoi retenir. ECoMEM sépare donc la tenue d'un compte rendu du passé de l'apprentissage de l'action, une idée proche des architectures hiérarchiques ou à mémoire structurée explorées autour de familles comme Pi-0 ou GR00T. Le projet est publié avec un site dédié (ecomem.github.io). Les prochaines étapes à surveiller sont une validation sur davantage de tâches réelles, des comparaisons directes avec des baselines à mémoire récentes, et la capacité à générer ou découvrir automatiquement de nouveaux concepts sans intervention humaine.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

RoboMemArena : un benchmark complet et exigeant pour la mémoire des robots
1arXiv cs.RO 

RoboMemArena : un benchmark complet et exigeant pour la mémoire des robots

Une équipe de chercheurs a publié sur arXiv (2605.10921) RoboMemArena, un benchmark de grande envergure conçu pour évaluer les capacités mémorielles des robots dans des tâches longues et partiellement observables. Le benchmark couvre 26 tâches distinctes, avec des trajectoires d'exécution dépassant en moyenne 1 000 étapes par tâche, dont 68,9 % des sous-tâches nécessitent explicitement la mobilisation de la mémoire passée. Sa pipeline de génération repose sur un modèle vision-langage (VLM) pour composer les sous-tâches, produire les trajectoires via des fonctions atomiques, et annoter les séquences clés (keyframes, instructions de sous-tâches). Une évaluation en environnement physique réel complète les expériences en simulation, ce qui distingue RoboMemArena des benchmarks existants. Les chercheurs proposent également PrediMem, une architecture VLA à double système : un planificateur VLM haut niveau gère une banque mémoire combinant un buffer récent et un buffer de keyframes, tandis qu'une tête de codage prédictif améliore la sensibilité aux dynamiques de tâche. PrediMem surpasse tous les modèles de référence testés sur RoboMemArena. Ce travail s'attaque à un angle mort persistant dans la recherche robotique : les systèmes actuels, y compris les VLA récents comme Pi-0, GR00T N2 ou Helix, sont majoritairement évalués sur des tâches courtes et observables, où la mémoire à long terme n'est pas critique. RoboMemArena expose la fragilité de ces architectures dès que l'horizon de décision s'allonge et que l'environnement devient partiellement observable. Pour un intégrateur ou un décideur B2B, le chiffre-clé est celui des 1 000 étapes : la plupart des benchmarks industriels actuels restent en dessous de 100 étapes, ce qui masque des lacunes importantes en conditions réelles. L'inclusion d'une évaluation physique réelle renforce la crédibilité des résultats, même si les détails de configuration matérielle ne sont pas précisés dans l'abstract. La question de la mémoire robotique n'est pas nouvelle : des travaux comme MemoryReplay, EpisodeVQA ou les architectures à attention récurrente (R-VLA) ont posé les bases, mais sans benchmark unifié à cette échelle. RoboMemArena s'inscrit dans une tendance plus large d'outillage de l'évaluation des VLA, aux côtés de BenchBot, RLBench2 ou Open X-Embodiment. PrediMem reste pour l'instant un modèle académique sans déploiement annoncé, et ses résultats devront être confirmés sur des plateformes matérielles tierces (Unitree G1, Figure 03, Boston Dynamics Atlas) pour convaincre au-delà du laboratoire. Les auteurs évoquent des lois de mise à l'échelle (scaling laws) pour les systèmes mémoriels complexes, ce qui suggère une piste de recherche active dans les mois à venir.

UELes laboratoires européens (CEA-List, INRIA) pourraient adopter RoboMemArena comme référence commune pour évaluer leurs architectures VLA sur des horizons longs, comblant l'absence actuelle de benchmark unifié à cette échelle.

RecherchePaper
1 source
RMBench : évaluation robotique des tâches dépendantes de la mémoire et implications pour la conception des politiques
2arXiv cs.RO 

RMBench : évaluation robotique des tâches dépendantes de la mémoire et implications pour la conception des politiques

La plupart des politiques de manipulation robotique développées ces dernières années accordent peu d'attention à la mémoire, ce qui les empêche de résoudre des tâches nécessitant un raisonnement sur des observations passées ou le maintien d'informations pertinentes dans la durée, deux exigences pourtant courantes en conditions réelles. Pour combler ce manque, une équipe de recherche présente RMBench, un benchmark de simulation composé de 9 tâches de manipulation couvrant plusieurs niveaux de complexité mémorielle, permettant d'évaluer systématiquement les capacités de mémoire des politiques robotiques. Les chercheurs proposent également Mem-0, une politique de manipulation modulaire dotée de composants de mémoire explicites, conçue pour permettre des études d'ablation contrôlées. Le travail s'appuie à la fois sur des expériences en simulation et en conditions réelles, et le site du projet est accessible à l'adresse rmbench.github.io. Ce travail est significatif car il met le doigt sur un angle mort persistant du secteur de la manipulation robotique par apprentissage : les modèles vision-langage-action (VLA) et autres politiques d'imitation progressent vite sur des tâches ponctuelles, mais la capacité à raisonner sur un historique d'observations, condition nécessaire pour de nombreuses tâches industrielles réelles comme le tri, l'assemblage séquentiel ou la manipulation d'objets partiellement occultés, reste peu testée et mal comprise. En fournissant un cadre d'évaluation standardisé plutôt que des démonstrations isolées, RMBench permet de distinguer les architectures qui gèrent réellement la mémoire de celles qui exploitent des raccourcis propres à un jeu de données, une nuance cruciale pour les intégrateurs qui évaluent la fiabilité d'une politique avant déploiement. Plusieurs politiques dites "memory-aware" avaient déjà été proposées dans la littérature, mais sans évaluation systématique ni compréhension claire du lien entre choix d'architecture et performance mémorielle. RMBench et Mem-0 s'inscrivent dans cette lignée de recherche en offrant un terrain de comparaison commun. Les auteurs indiquent avoir identifié, via leurs expériences, des limites mémorielles concrètes dans les politiques existantes, et fournissent des enseignements empiriques sur les choix de conception à privilégier. La publication constitue une révision (v3) d'un article déjà déposé sur arXiv, signe d'itérations successives avant une possible soumission à une conférence de robotique ou d'apprentissage automatique.

RecherchePaper
1 source
T$^2$Mem : apprendre une mémoire au moment du test pour la robotique
3arXiv cs.RO 

T$^2$Mem : apprendre une mémoire au moment du test pour la robotique

Des chercheurs présentent sur arXiv T²Mem, un cadre qui donne une mémoire à une politique vision-langage-action (VLA) pré-entraînée qui n'en avait pas. La méthode repose sur l'entraînement au moment du test (test-time training). Le système ne retraite pas tout l'historique à chaque décision. Il encode les observations passées dans des « poids rapides » compacts, mis à jour en ligne par apprentissage auto-supervisé. Une interface ancrée dans les observations extrait l'information vision-langage qui alimente la mémoire, puis renvoie le contexte récupéré à l'action expert de la politique. L'entraînement alterne entre mémoire et politique, chacune restant figée pendant l'optimisation de l'autre. Sur les 16 tâches du benchmark RoboMME, le taux de succès moyen passe de 17,93 % à 56,83 % par rapport à la politique de base. T²Mem dépasse aussi les méthodes à mémoire récurrente rapportées dans ce benchmark. Les auteurs annoncent une inférence au moins trois fois plus rapide que les méthodes explicites, mesurée par profilage contrôlé. Ce travail s'attaque à une faiblesse structurelle des VLA. Ils décident surtout à partir de l'observation courante, alors que de nombreuses tâches de manipulation dépendent d'informations qui ne sont plus visibles, comme un objet masqué ou une étape déjà exécutée. Point notable : la mémoire est apprise à partir des seules démonstrations d'actions, sans modèle de raisonnement externe ni annotations dédiées. Cela réduit le coût de données et la complexité d'intégration. Le gain de latence compte pour les boucles de contrôle temps réel. Plusieurs réserves s'imposent. Il s'agit d'un préprint évalué sur benchmark, et le résumé ne mentionne ni validation sur robot physique ni déploiement. L'accélération est mesurée par les auteurs eux-mêmes. Enfin, 56,83 % de réussite moyenne reste loin d'une fiabilité industrielle. Le contexte est celui de politiques généralistes qui ont progressé en dextérité mais restent largement sans état. Les approches de mémoire existantes reposent sur des historiques explicites, des modules de raisonnement externes ou des mémoires récurrentes, d'où la comparaison menée ici avec ces dernières. Le résumé ne nomme pas la politique de base utilisée, ce qui limite pour l'instant la lecture de la portée du gain. Un site projet est annoncé. Les prochaines étapes à surveiller sont la reproduction sur d'autres politiques de base, les essais sur robots réels et une éventuelle reprise du principe dans les modèles de fondation robotiques commerciaux.

RecherchePaper
1 source
Ancrages de mémoire pour l'apprentissage continu des robots
4arXiv cs.RO 

Ancrages de mémoire pour l'apprentissage continu des robots

Des chercheurs présentent, dans un article publie le 28 aout 2026 sur arXiv (2608.26545v1), une méthode baptisée "Memory Anchors" pour lutter contre l'oubli catastrophique des robots qui apprennent de nouvelles taches en continu. Le principe s'appuie sur les buffers de rejeu, habituellement échantillonnés au hasard parmi les expériences passées pour reentrainer la politique sur d'anciennes taches en parallèle des nouvelles. Les auteurs montrent qu'un petit sous ensemble de ces expériences, les "ancres mémoire", concentre l'essentiel de la protection: ce sont les cas ou les représentations internes d'observations d'une nouvelle tache s'effondrent sur celles d'une ancienne tache alors que les deux exigent des actions contradictoires, par exemple manipuler différemment un objet déjà connu. Sur la suite de benchmarks LIBERO, exclure seulement 10% de ces ancres du buffer multiplie par plus de 4,5 l'oubli catastrophique mesure. A l'inverse, enrichir le buffer en ancres mémoire réduit de 63% l'oubli sur les taches a fort conflit et permet un apprentissage continu réussi de deux séquences de taches sur un robot réel. Videos et visualisations sont disponibles sur robot-adaptation.github.io/MemoryAnchors. Pour les intégrateurs qui déploient des politiques robotiques de type VLA en production, l'oubli catastrophique reste un frein concret a la mise a jour continue des flottes: chaque nouvelle compétence ajoutée risque de dégrader des comportements déjà valides sur le terrain. En montrant qu'une fraction minime, environ 10%, du buffer de rejeu porte l'essentiel de la stabilité du système, ce travail suggère que le cout mémoire et calcul de l'apprentissage continu peut baisser sans sacrifier la rétention, un enjeu direct pour les couts de stockage et de reentrainement a l'échelle d'une flotte. La validation sur robot réel, au delà de la simulation LIBERO, renforce la crédibilité de l'approche, même si elle reste limitée a deux séquences de taches et ne démontre pas encore un passage a l'échelle vers des dizaines de compétences. L'approche s'inscrit dans la lignée des méthodes de rehearsal en apprentissage continu, ou le problème central est de choisir quelles expériences rejouer sans faire exploser la taille du buffer ni le temps d'entrainement; l'échantillonnage aléatoire restait jusqu'ici la norme faute de critère fiable. Le benchmark LIBERO, standard pour évaluer l'apprentissage continu de politiques robotiques, sert de terrain de comparaison. Aucun acteur industriel ni déploiement commercial n'est associe a cette publication, qui relève pour l'instant de la recherche académique; les prochaines étapes attendues portent sur l'extension a un plus grand nombre de taches et l'intégration éventuelle de ce critère de sélection dans des pipelines d'entrainement de politiques généralistes.

RecherchePaper
1 source