Diviser pour mémoriser : une mémoire récursive centrée sur l'action pour les politiques VLA à long horizon
Des chercheurs proposent Divide-and-Remember (D&R), une méthode de mémoire récursive pour les politiques VLA (vision-language-action) appliquées à la manipulation de longue durée. Le papier, publié sur arXiv (2610.00982), s'attaque aux tâches dites dépendantes de l'historique, où l'observation courante ne suffit pas à déterminer l'action. D&R apprend une fonction de mémoire mt = M(ht) en s'appuyant sur une sélection récursive : la sélection sur l'historique complet est découpée en sous-problèmes de type top-K sur 2K tokens. Des sélecteurs légers, de taille fixe et entraînés de bout en bout, peuvent ainsi gérer un historique non borné. Tous les blocs de récursion partagent un unique sélecteur, ce qui limite le coût de calcul. Sur RoboMME, un benchmark de 16 tâches de manipulation longue qui exigent de se souvenir du quand, du où, du quoi et du comment agir, D&R atteint le meilleur taux de succès moyen publié, avec des gains constants sur les quatre suites, pour un budget de seulement 64 tokens de mémoire. Les auteurs affirment que des essais sur robot réel confirment le gain, sans en donner les chiffres dans le résumé. Le code et les checkpoints sont publiés.
L'enjeu dépasse le seul score de benchmark. Les VLA actuels restent largement réactifs : ils se débrouillent quand la scène contient l'information utile, mais échouent dès qu'il faut se rappeler quel objet a été déplacé, quelle étape est déjà faite ou où un élément a disparu. Ces cas sont fréquents en logistique, en assemblage et en tâches de service. Les méthodes existantes de mémoire reposent sur des heuristiques fixées à la conception, comme conserver les images à forte variation de pixels, et donnent des résultats irréguliers selon les tâches. Le papier les remplace par un critère théorique : la mémoire optimale maximise l'information mutuelle conditionnelle entre l'action et la mémoire, sachant l'observation courante. Autrement dit, elle ne garde que ce qui, dans le passé, est utile à l'action et absent de la vue présente. Pour un intégrateur, le point clé est le budget : 64 tokens, c'est une mémoire compatible avec une inférence embarquée, là où allonger le contexte fait exploser latence et coût. Il faut toutefois rester prudent : RoboMME est un benchmark principalement simulé, et la validation sur robot réel n'est détaillée que dans le papier complet. Il s'agit d'un résultat de recherche, pas d'un produit déployé.
Ce travail s'inscrit dans la montée en puissance des VLA généralistes, comme Pi-0 ou GR00T, qui traitent surtout une observation courte ou quelques images récentes. La mémoire à long horizon est identifiée comme un point faible de ces architectures, et plusieurs équipes explorent la compression du contexte, la mémoire par mots-clés ou les représentations récurrentes. D&R se distingue par sa formulation en problème d'optimisation, issue du cadre POMDP de l'apprentissage par imitation. Les prochaines étapes à surveiller sont la reproduction des résultats sur d'autres benchmarks, les chiffres détaillés sur robot réel et l'intégration dans des modèles de fondation de grande taille.
Dans nos dossiers




