Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon
Des chercheurs proposent ActMem-VLA, une architecture qui ajoute une mémoire de l'historique des actions à un modèle vision-langage-action (VLA) déjà entraîné, sans le ré-entraîner. Le système greffe sur une politique de base figée (fine-tunée puis gelée) un plugin composé d'un module mémoire basé sur Mamba, un modèle à espace d'états, et d'un expert léger baptisé PreAction Expert (PAE). Mamba encode les actions déjà exécutées, et cette mémoire conditionne le PAE avec le contexte courant. Pendant les premières étapes de débruitage, à fort bruit, le PAE oriente la progression de la tâche. Il transmet ensuite l'action partiellement débruitée à l'Action Expert (AE) figé, qui affine les détails sur les étapes restantes à faible bruit. Seuls Mamba et le PAE sont optimisés. Sur le benchmark LIBERO-Mem, ActMem-VLA atteint 80,8 % de réussite moyenne sur les dix tâches, contre 65,2 % pour π0.5 et 49,5 % pour MemoryVLA, pour seulement 3,45 % de paramètres supplémentaires. Sur quatre tâches réelles, le gain moyen sur π0.5 est de 28,8 %. L'article ne précise pas s'il s'agit de points de pourcentage ou d'un gain relatif.
L'enjeu est le « perceptual aliasing » : à deux étapes différentes d'une tâche longue, l'observation et l'état du robot peuvent être quasi identiques, alors que l'action correcte diffère. Sans accès à l'historique, la politique hésite ou répète une étape déjà faite. Le résultat compte pour les intégrateurs, car la mémoire est ici un module ajouté à un VLA existant, sans repartir d'un entraînement complet. Un modèle de base validé en production pourrait ainsi gagner en fiabilité sur les séquences longues (assemblage multi-étapes, kitting, tri) pour un surcoût de calcul modeste. Le score de 80,8 % montre aussi qu'il reste près d'une tentative sur cinq en échec. LIBERO-Mem est de plus un benchmark de simulation conçu pour tester la mémoire, et l'évaluation réelle ne porte que sur quatre tâches, sans détail public dans le résumé sur le nombre d'essais.
Le travail s'inscrit dans une série de méthodes qui injectent des indices temporels ou de progression dans les VLA, par conditionnement de features, modification de l'a priori d'action ou guidage de l'échantillonnage. MemoryVLA, comparé ici, fait partie de cette famille. Le coût de ces approches, qui entraînent conjointement la mémoire et le VLA de base, motive la séparation choisie par les auteurs entre pilotage conditionné par l'historique et raffinement par la politique figée. Le point de comparaison principal reste π0.5 de Physical Intelligence. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Aucun déploiement industriel ni code n'est mentionné dans le résumé, et les prochaines étapes probables sont une validation sur d'autres bases VLA et sur des tâches réelles plus longues.
Dans nos dossiers




