Garder l'effet, supprimer l'acteur : modèles monde-action programmables de l'effet à l'exécution
Des chercheurs proposent PEWAM, un modèle monde-action de 71,5 millions de paramètres qui part d'une idée simple : une démonstration robotique enregistre à la fois ce qui arrive aux objets et la façon dont un bras précis l'a obtenu, et seul le premier élément devrait être conservé. La démonstration est « compilée » en un programme d'effet : trajectoires de keypoints 3D des objets déplacés, deux points indiquant où chacun a été saisi, et configuration finale de la scène, démonstrateur effacé. PEWAM génère quatre flux (effet, exécution du robot, action, état terminal) avec des temps de flow-matching indépendants. Fixer le programme et échantillonner l'exécution revient à « programmer » le robot, avec une résolution répétée en boucle fermée depuis la scène réelle. Sur les tâches LIBERO-Goal hors entraînement, le programme issu d'une seule démonstration réussit 40 épisodes sur 90, contre 19 au maximum pour le même backbone conditionné par une image-but ou du langage, et pour les méthodes publiées conditionnées par démonstration. Sur Meta-World, il dépasse les meilleurs résultats publiés sur trois classes tenues à l'écart, mais pas sur la moyenne des cinq classes.
L'enjeu pratique tient à la nature du programme : un ensemble de coordonnées, donc modifiable par un opérateur. Décaler l'état terminal déplace le placement, et pivoter les points de contact fait tourner la prise. Le même programme s'exécute sur quatre bras différents sans réentraînement, ce qui touche directement le problème de transfert entre embodiments qui freine les intégrateurs. Après une poussée perturbatrice, la ré-résolution réussit 23 épisodes sur 60, contre 6 pour un simple rejeu de la démonstration, un écart qui illustre la fragilité des approches par rejeu. Sur un bras Franka, affiné sur des démonstrations réelles d'autres tâches, des programmes compilés à partir de vidéos humaines uniques aboutissent à 36 essais sur 40, contre 22 pour le même backbone conditionné par la dernière image de la vidéo. Ces résultats suggèrent qu'apprendre un « quoi » explicite plutôt qu'un « comment » lié à un acteur améliore la généralisation, mais ils proviennent d'une publication préprint, sans évaluation indépendante.
Il faut relativiser la portée : LIBERO et Meta-World sont des benchmarks de simulation, et seule l'expérience Franka touche au réel, sur un nombre limité d'essais (40). Un taux de 40/90 en simulation reste loin d'un seuil de fiabilité industriel. Le travail s'inscrit dans la course aux VLA et modèles monde-action, face à des approches généralistes comme Pi-0 ou GR00T, qui misent sur l'échelle des données plutôt que sur une représentation intermédiaire éditable. Sa taille réduite (71,5M de paramètres, très inférieure aux modèles de ces acteurs) en fait une piste intéressante pour l'imitation à partir d'une seule vidéo humaine. Les prochaines étapes à surveiller sont la validation sur des tâches réelles plus variées, la robustesse de l'extraction de keypoints en environnement encombré et une éventuelle mise à disposition du code. Aucun acteur français ou européen n'est cité dans cette publication.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




