WholeBodyWAM : des modèles d'action du monde pour le corps entier avec des a priori de mouvement évolutifs
Un article déposé sur arXiv (2609.18197v1) présente WholeBodyWAM, un modèle "world-action" pour la manipulation corps entier des robots humanoïdes. Le constat de départ : les trajectoires corps-entier propres à un robot cible sont coûteuses à collecter et peu scalables, alors que le mouvement humain et humanoïde existe en abondance sans pouvoir servir directement d'action robotique faute de correspondance d'embodiment. Les auteurs ont constitué UniMotion-4K, un corpus de plus de 4000 heures issu de vidéos humaines, de jeux de données 3D natifs et de plateformes humanoïdes hétérogènes, unifiés dans un espace de mouvement commun. Un "Motion Expert" conditionné par le langage y est pré-entraîné à prédire le mouvement futur du corps entier sans supervision d'action robot, puis combiné en post-entraînement à un Video Expert et un Action Expert via une attention asymétrique de type Mixture-of-Transformers (MoT).
Ce travail cible un goulot d'étranglement connu du secteur : le coût et la rareté des données de téléopération spécifiques à chaque plateforme, qui freinent le passage à l'échelle des modèles vision-langage-action (VLA). Les auteurs rapportent une amélioration continue de la prédiction de mouvement futur et des tâches en aval à mesure que le volume de pré-entraînement sur le mouvement augmente, avec un transfert effectif vers des tâches de manipulation réelle sur humanoïde. Point notable pour les intégrateurs et décideurs B2B : le gain d'efficacité des données est le plus marqué quand les démonstrations sur le robot cible sont limitées, ce qui pointe vers une réduction possible du volume de données réelles nécessaire pour déployer un nouvel humanoïde sur une tâche donnée.
Il s'agit d'un article de recherche, sans entreprise ni déploiement commercial identifié dans le résumé : les expériences restent en environnement contrôlé, loin d'un produit livré ou d'un pilote industriel annoncé. La démarche s'inscrit dans une tendance plus large du secteur, qui cherche à séparer l'apprentissage de la dynamique physique générale, à partir de vidéos et de mouvements massifs, de l'apprentissage de l'action spécifique à un robot donné, une logique proche de celle des modèles VLA commerciaux comme Pi-0 ou GR00T N2. L'abstract ne mentionne ni date de mise en production ni partenaire industriel, seulement la démonstration de la transférabilité du prior de mouvement appris et de son bénéfice en contexte de données limitées.
Dans nos dossiers




