Une mémoire simple à base d'agents pour les politiques robotiques généralistes
Des chercheurs proposent SimpleARM (Simple Agentic Robot Memory), une couche de mémoire sans entraînement pour politiques robotiques généralistes gelées, décrite dans un preprint arXiv (v1). Le système fonctionne en quatre temps : à partir de l'instruction de la tâche, il détermine ce qu'il faut surveiller ; des outils perceptifs gelés maintiennent en ligne un état compact et typé ; un accès structuré ne récupère cet état que lorsqu'un sous-objectif proposé dépend de l'historique ; enfin, un ancrage dans la vue courante résout les entités rappelées avant l'exécution. L'évaluation porte sur RoboMME, un benchmark de 16 tâches de manipulation dont la réussite exige des informations qui ne sont plus visibles dans l'observation actuelle. Sur les 16 tâches et trois graines de politique, SimpleARM atteint 67,17 % de réussite moyenne, contre 44,51 % pour la meilleure base de comparaison non oracle. Des ablations appariées montrent que retirer l'état de relation, de référence, de progression ou d'itinéraire provoque de fortes chutes là où cet état est mobilisé, et épargne largement les autres tâches.
L'enjeu dépasse le gain chiffré, soit environ 22,7 points. Les systèmes de mémoire visuelle actuels conservent ou compressent des observations passées, en supposant que l'historique utile se retrouve dans les images. Or le contrôle robotique dépend aussi d'un état issu de l'interaction, qu'aucune image ne représente explicitement : quel objet est lequel après avoir été déplacé, où en est la tâche, dans quel ordre exécuter une procédure. Les résultats plaident pour une mémoire conçue comme un état compact et pertinent pour la tâche, plutôt que comme un historique visuel étendu. Pour les intégrateurs et les équipes qui déploient des politiques VLA gelées, l'intérêt pratique est réel : la couche s'ajoute sans réentraînement, donc sans coût de collecte de données ni de fine-tuning. La spécificité des ablations renforce la crédibilité du mécanisme. Des réserves s'imposent toutefois : les résultats proviennent d'un benchmark, avec des tâches vraisemblablement simulées, sans preuve de déploiement réel, et l'écart avec les approches plus complexes reste à vérifier hors de RoboMME.
Ce travail s'inscrit dans la montée des modèles généralistes gelés, de type VLA, qui excellent en réactivité mais restent faibles sur les tâches à longue portée dépendant du passé. Les approches concurrentes se répartissent entre conservation brute de trames, compression de contexte visuel et mémoires apprises de bout en bout, toutes exposées au même défaut : ne pas capter l'état implicite. SimpleARM adopte une orientation « agentique », où des outils spécialisés remplissent l'état plutôt que la politique elle-même. Les suites logiques seraient des tests sur robot physique, d'autres benchmarks de mémoire et une comparaison avec des politiques entraînées avec mémoire native. Le preprint n'annonce ni code, ni pilote, ni calendrier, et n'a pas encore été évalué par des pairs.
Dans nos dossiers




