
WB-WAM : pré-entraînement hétérogène corps-main pour la locomanipulation humanoïde
Des chercheurs publient WB-WAM, un « World Action Model » (modèle qui prédit conjointement la vidéo future et les actions) conçu pour la manipulation mobile des humanoïdes (loco-manipulation). Il apprend à partir de 1 880,2 heures de vidéos et de données de mouvement annotées de façon partielle. Un espace d'action physique commun fusionne des annotations hétérogènes : articulations du corps, déplacement de la base (root) et doigts de la main dextre. Les priors ainsi obtenus sont affinés par une étape intermédiaire baptisée PICO, puis adaptés aux tâches robotiques avec une supervision auxiliaire par cinématique directe. Les auteurs ont construit WB-Datasets, qui combine démonstrations humaines égocentriques retargetées sur le robot et trajectoires robotiques. En simulation, le modèle atteint 81,9 % de réussite sur HumanoidArena. En conditions réelles, il affiche 84,0 % de succès moyen sur cinq tâches. L'article ne précise ni le robot utilisé, ni le nombre d'essais par tâche, ni les modèles de référence comparés dans ces chiffres.
Le point central tient à la donnée. Les corpus de pré-entraînement robotique couvrent mal les mouvements du corps entier, alors que les humanoïdes doivent coordonner jambes, torse, bras et mains dans une même tâche. WB-WAM suggère qu'on peut combler ce manque en réutilisant des démonstrations humaines égocentriques, plus faciles à collecter que la téléopération sur robot. Les auteurs affirment que la mi-formation PICO alignée sur la tâche améliore les performances et réduit le nombre de démonstrations réelles nécessaires. Pour un intégrateur, c'est un levier de coût : le goulot d'étranglement actuel est le volume de données robot, pas l'architecture. À nuancer : 84 % de réussite sur cinq tâches reste un chiffre de laboratoire, sans information sur la durée de cycle, la robustesse hors distribution ou la fiabilité sur de longues périodes, qui comptent pour un déploiement industriel. Le résultat soutient la voie des modèles vidéo-action, sans prouver qu'elle passe à l'échelle en production.
Ce travail s'inscrit dans la montée des modèles d'action fondés sur la vidéo générative, en parallèle des VLA (vision-langage-action) comme Pi-0, GR00T ou Helix. Ces derniers se concentrent souvent sur la manipulation à bras fixes ou semi-mobile, tandis que WB-WAM vise le corps entier, mains dextres comprises. Les acteurs de l'humanoïde industriel (Figure, Tesla avec Optimus, Agility, ainsi que les acteurs européens comme Wandercraft ou Enchanted Tools) font face au même problème de données, ce qui rend les approches de transfert depuis l'humain stratégiques. Il s'agit ici d'une prépublication arXiv (version 2), sans produit ni pilote annoncé. La suite à surveiller : la publication du code et des jeux de données WB-Datasets, la reproduction par d'autres équipes, et la validation sur des tâches plus longues et plus variées.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




