Modèle du monde humanoïde avec génération conjointe des états et des actions
Des chercheurs proposent HWAM (Humanoid World Action Model), une politique pour robots humanoïdes qui génère conjointement les actions de référence et l'état corporel réellement atteint après exécution, c'est-à-dire l'état proprioceptif post-exécution. L'entraînement repose sur trois chemins conditionnels complémentaires. Le chemin « Policy » débruite conjointement des trajectoires état-action à partir des seules observations courantes, ce qui correspond aux conditions de déploiement. Le chemin de modélisation dynamique directe (FDM) prédit les observations visuelles futures à partir des actions et des états post-exécution. Le chemin de modélisation dynamique inverse (IDM) reconstruit la trajectoire conjointe à partir des transitions visuelles. L'évaluation porte sur trois tâches réelles avec l'humanoïde LimX OLI. HWAM obtient le meilleur taux de réussite parmi les références comparées. Sur la tâche « Candy Picking », il atteint 70,6 %, contre 43,3 % pour Fast-WAM. Les résultats des deux autres tâches ne sont pas détaillés dans le résumé disponible.
Le travail s'attaque à un problème peu visible dans les démonstrations : l'écart entre action et exécution. Dans les systèmes humanoïdes hiérarchiques, la politique (VLA ou WAM) sort des actions de référence que le contrôle du corps entier met ensuite en œuvre, avec la dynamique du robot, l'équilibre et les contacts. Le mouvement réellement réalisé peut donc différer de la consigne. Sans modéliser cet état réalisé, la prédiction visuelle du futur doit expliquer à la fois l'évolution de la scène et ces écarts, ce qui brouille le lien entre une action et son résultat physique. En faisant de l'état post-exécution une cible explicite, HWAM injecte directement dans l'apprentissage une supervision du mouvement exécuté. Pour les intégrateurs, l'enseignement est que le goulot d'étranglement des manipulateurs humanoïdes se situe aussi dans la couche de contrôle bas niveau, et pas seulement dans la perception ou le langage. Il faut toutefois rester prudent. Le gain de plus de 27 points sur Candy Picking provient d'une seule tâche, d'un seul robot et d'un nombre d'essais non précisé dans le résumé. Il s'agit d'un résultat de laboratoire publié en préprint sur arXiv, sans déploiement industriel ni produit associé.
Ce travail s'inscrit dans l'évolution des politiques VLA, qui apprennent les actions directement depuis des observations multimodales, vers les World Action Models, qui ajoutent la prédiction visuelle du futur pour mieux générer les actions. Fast-WAM, la référence directe citée, représente cette seconde famille. La comparaison avec d'autres approches de la catégorie, comme Pi-0 ou GR00T, n'est pas mentionnée dans le résumé. Le choix du LimX OLI, humanoïde de la société LimX, indique aussi que la recherche sur la manipulation humanoïde s'appuie de plus en plus sur des plateformes de fabricants chinois. Les prochaines étapes naturelles seraient une validation sur davantage de tâches et de morphologies, ainsi qu'une comparaison avec les modèles de fondation généralistes. Aucun calendrier de pilote ni de publication de code n'est annoncé dans le texte disponible.
Dans nos dossiers



