
La mémoire comme plan : modélisation monde-action ancrée dans la mémoire
Publié le 11 septembre 2026 sur arXiv (référence 2609.11561v1), un article de recherche présente MaP-WAM, un nouveau cadre pour piloter des robots manipulateurs sur des tâches longues nécessitant de la mémoire. Contrairement aux politiques robotiques dominantes, formulées de façon markovienne et ne conditionnant l'action que sur l'observation courante, MaP-WAM sépare le traitement en deux étapes : une planification ancrée dans la mémoire épisodique multimodale, puis une exécution conditionnée par ce plan. La mémoire est stockée sous forme de segments de tâche déjà accomplis, combinant instructions en langage et contexte visuel épars, puis convertie en plans compacts (un plan langagier pour le segment suivant, accompagné d'une consigne visuelle). Un modèle World-Action-Progress (WAP) exécute chaque plan sur une durée non fixée à l'avance, en prédisant conjointement des blocs d'actions et une estimation de progression, recalibrée par alignement plan-observation pour déclencher les transitions de segment. Sur le benchmark RMBench, MaP-WAM atteint 83,3% de réussite, un résultat présenté comme état de l'art, et 78,0% sur des tâches exécutées par un robot réel.
Ce travail cible un point de friction connu des modèles vision-langage-action (VLA) déployés en environnement industriel : la plupart des politiques actuelles raisonnent sur une fenêtre d'observation limitée, efficace pour des gestes courts mais fragile sur des séquences de manipulation longues et non markoviennes. Les approches concurrentes, résumé en langage ou fenêtre visuelle croissante, dégradent soit la précision visuelle soit la latence à mesure que l'historique s'allonge. En maintenant une latence d'inférence quasi constante malgré un historique croissant, MaP-WAM répond directement à ce compromis, ce qui intéresse les intégrateurs cherchant des cadences stables sur des tâches multi-étapes comme l'assemblage ou le tri avec dépendances.
MaP-WAM s'inscrit dans la lignée des modèles VLA génériques tels que Pi-0, GR00T N2 ou Helix, structurés autour d'une hypothèse markovienne limitant leur portée temporelle, et dont les tentatives précédentes d'ajout de mémoire n'avaient pas résolu ce compromis couverture-efficacité. À ce stade, il s'agit d'une publication de recherche non encore relue par les pairs, testée sur RMBench et un nombre limité de tâches réelles, sans partenariat industriel ni calendrier d'intégration annoncés. Aucun acteur français ou européen n'apparaît dans cette publication.
Dans nos dossiers




