PACE : manipulation robotique cohérente par étapes sur de longs horizons grâce à un contexte aligné sur la progression
Des chercheurs proposent PACE (Progress-Aligned Context for Execution), une méthode destinée aux politiques robotiques conditionnées par démonstration, dans le cadre de la manipulation longue durée. Le problème visé porte le nom de « stage confusion » : lorsque des états visuellement proches reviennent à différentes étapes d'une tâche, ou lorsque la démonstration et l'exécution n'avancent pas à la même vitesse, la politique perd le fil et se trompe d'étape. PACE compresse la démonstration complète en jetons de prompt multimodaux ordonnés, et s'appuie, pendant l'entraînement uniquement, sur une supervision d'attention « à double arête » (dual-edge) pour faire apparaître la structure latente des étapes. À l'exécution, une mémoire à poids rapides (fast-weight), propre à l'épisode, encode de façon causale les transitions action-observation réellement effectuées et module la cross-attention sur le prompt. Un expert d'action unifié, basé sur la diffusion, reçoit ainsi un contexte aligné sur la progression, sans étiquettes d'étape au test ni politiques spécifiques à chaque étape. Sur LIBERO-Gen, le taux de réussite passe de 88,9 % à 94,0 % sur Goal Chain, et de 79,1 % à 83,3 % sur Spatial Combination. Sur les tâches Block Routing en deux étapes, il bondit de 33,3 % à 73,3 %.
L'intérêt tient moins au gain sur les benchmarks LIBERO, déjà proches de la saturation et modestes (+5,1 et +4,2 points), qu'au diagnostic posé : une part notable des échecs des politiques VLA et des politiques à diffusion sur les tâches séquentielles viendrait d'une mauvaise localisation dans la tâche, et non d'un déficit de dextérité ou de perception. Le doublement du succès sur Block Routing, où les états se répètent entre les étapes, va dans ce sens, et l'analyse d'échecs des auteurs indique que l'alignement structuré de la démonstration et la mémoire causale contribuent conjointement. Pour les intégrateurs, la promesse est de spécifier un comportement par une démonstration unique sans réentraîner de politique par étape, ce qui réduit le coût de mise en production d'enchaînements d'assemblage ou de tri. Les réserves sont nettes : les résultats proviennent de simulation, d'une seule version préprint, sans validation sur robot réel ni mesure de latence ajoutée par la mémoire. Le gain sur Block Routing part en outre d'une base très basse, ce qui en amplifie l'effet apparent.
PACE s'inscrit dans la lignée des politiques généralistes de type VLA (Pi-0, GR00T, Helix) et des approches par imitation conditionnée sur démonstration, qui peinent sur les horizons longs faute de mémoire d'exécution explicite. Il rejoint les travaux sur les mémoires épisodiques et les couches à poids rapides pour la robotique. Les auteurs ne citent pas de déploiement industriel ni de calendrier. Les prochaines étapes logiques sont des tests sur robots physiques, des comparaisons directes avec les grands VLA du marché et une évaluation sur des tâches plus longues que deux étapes. Aucun acteur français ou européen n'est mentionné dans cette publication.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




