ECoMEM : une mémoire à concepts explicites pour le contrôle de robots dépendant de la mémoire
Des chercheurs proposent ECoMEM (Explicit Concept Memory), une architecture de mémoire pour les politiques robotiques de type vision-langage-action (VLA), publiée sur arXiv en octobre 2026. Le système remplace l'historique brut ou la mémoire implicite apprise par une bibliothèque réutilisable de « concepts » ancrés dans les observations, par exemple la position d'un objet disparu du champ de vision, ce qu'un humain a démontré plus tôt, ou les étapes déjà accomplies d'une tâche. Un module Writer, fondé sur des preuves observées, sélectionne et met à jour ces enregistrements. Un module Reader, appris, les convertit en tokens de mémoire qui conditionnent directement la VLA. Sur le benchmark RoboMME (16 tâches), ECoMEM arrive en tête des politiques évaluées sur 15 tâches. Sur deux nouvelles tâches en robot réel, la même bibliothèque de concepts est soit réutilisée telle quelle, soit complétée par un seul nouveau concept. Le taux de succès atteint 86,1 %, contre 8,6 % pour une VLA sans mémoire. Les auteurs ne précisent pas, dans le résumé, la plateforme robotique, le nombre d'essais ni la VLA de base utilisée.
Ce travail s'attaque à une faiblesse structurelle des VLA actuelles : elles décident à partir de l'observation courante et échouent dès que l'information utile n'est plus visible. Or les tâches à long horizon rencontrées en logistique, en assemblage ou en service (retrouver une pièce rangée hors champ, reprendre une séquence interrompue, répéter une démonstration) en dépendent. L'écart 86,1 % contre 8,6 % montre surtout que le cas sans mémoire est un plancher quasi nul sur ces tâches, ce qui est attendu par construction. La comparaison la plus utile serait celle avec les mémoires à historique long ou implicites. Pour les intégrateurs, l'intérêt tient à l'extensibilité annoncée : ajouter un concept plutôt que réentraîner une politique entière réduirait le coût d'adaptation à un nouveau poste. Il tient aussi à l'inspectabilité, car une mémoire explicite peut être lue et débogguée, ce qui compte pour la validation en environnement industriel. Ces affirmations restent à confirmer sur un nombre de tâches réelles réduit à deux, avec une définition des concepts qui reste conçue par des humains.
Le résultat s'inscrit dans un débat de fond sur la mémoire des modèles robotiques. Les approches dominantes allongent le contexte d'images passées ou apprennent une mémoire latente à partir des seules trajectoires observation-action, ce que les auteurs jugent insuffisant puisque la supervision d'action n'indique pas quoi retenir. ECoMEM sépare donc la tenue d'un compte rendu du passé de l'apprentissage de l'action, une idée proche des architectures hiérarchiques ou à mémoire structurée explorées autour de familles comme Pi-0 ou GR00T. Le projet est publié avec un site dédié (ecomem.github.io). Les prochaines étapes à surveiller sont une validation sur davantage de tâches réelles, des comparaisons directes avec des baselines à mémoire récentes, et la capacité à générer ou découvrir automatiquement de nouveaux concepts sans intervention humaine.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




