La mémoire qui modifie l'action n'est pas la mémoire qui la guide : audit contrefactuel des politiques robotiques conditionnées par l'historique
Une équipe de recherche publie sur arXiv (2609.27247v1) un protocole d'audit baptisé Counterfactual Memory Audit (CMA), qui vérifie si un robot doté d'une mémoire d'historique s'en sert réellement pour choisir ses actions, plutôt que de simplement réagir. Le cas d'école : un robot chargé de remettre un bloc sur son plateau d'origine peut avoir vécu deux passés différents mais compatibles avec la tâche, qui convergent vers la même situation présente tout en justifiant des actions distinctes. CMA croise ces historiques à un instant présent identique et interroge une politique figée sous aléa commun. Sur le benchmark Mem-0, toutes les paires "Put Back" testées changent d'action selon la mémoire fournie, mais seulement 20 sur 64 se révèlent pleinement fiables, alors qu'à une décision "Swap" ultérieure les deux mémoires sélectionnent la même branche malgré un changement d'action mesurable. Restaurer une ancre protégée de 4096 octets récupère 38,9 points de succès perdus après injection de fautes dans la banque d'historique, et sur une plateforme physique à deux bras, 5 des 9 manipulations "Put Back" menées à terme visent malgré tout la mauvaise cible.
Ce travail met en cause un présupposé implicite du secteur : la validation des politiques robotiques à mémoire (VLA) repose sur le succès de la tâche ou sur le simple constat qu'une action change avec la mémoire, deux critères qui ne prouvent pas qu'un robot raisonne sur son passé. Pour les intégrateurs qui évaluent des architectures à mémoire longue pour l'industrie ou la logistique, CMA offre un test de fiabilité décisionnelle plus strict, utile avant déploiement, quand un rappel erroné produit un geste correct en apparence mais mal ciblé.
L'étude s'inscrit dans la multiplication récente des politiques robotiques conditionnées par l'historique, censées permettre à un bras ou un robot mobile de lever une ambiguïté présente en tenant compte d'événements passés, capacité revendiquée par les modèles vision-langage-action. En combinant benchmark simulé et plateforme physique, les auteurs montrent que l'écart entre démonstration et fiabilité réelle persiste même quand la mémoire modifie visiblement le comportement. CMA est proposé comme outil d'audit générique, transposable à d'autres politiques à mémoire.
Dans nos dossiers




