
Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines
Des chercheurs présentent Workhorse, un système qui apprend la loco-manipulation du corps entier pour humanoïdes à partir de démonstrations humaines enregistrées sans robot (arXiv 2610.09117). L'architecture sépare deux politiques. Un planificateur visuel, alimenté par des images RGB égocentriques et la proprioception, prédit cinq cibles de liens : le torse, les deux poignets et les deux pieds. Un contrôleur de suivi du corps entier, entraîné par apprentissage par renforcement, exécute ensuite ces poses sur le robot. Les deux politiques sont entraînées séparément sur les mêmes poses humaines, sans retargeting vers la morphologie du robot. Chacune est aussi entraînée sur des données augmentées qui imitent les erreurs de l'autre au déploiement. Sur un Unitree G1 réel, le système trie des boîtes avec les mains et un coup de pied, attrape une boîte lancée, puis fait basculer une valise et grimpe dessus. Il récupère aussi après une poussée ou le retrait de la boîte par une personne. Dans une copie simulée de la salle de démonstration, le tri aboutit dans 77 % des épisodes, et dans 64 % sous poussées de 40 N.s. Avec les deux politiques réentraînées sur les mêmes démonstrations, un second humanoïde simulé atteint 83 % sans poussées.
L'intérêt tient à la façon de contourner deux goulets d'étranglement. Les humanoïdes peinent à planifier des manipulations riches en contacts, où le corps entier participe, à partir de la seule vision embarquée. Et la téléopération robot, qui produit l'essentiel des données d'entraînement actuelles, coûte cher et passe mal à l'échelle. Utiliser des démonstrations humaines brutes, sans passer par le retargeting, simplifie la collecte et ouvre la voie à des corpus plus larges. L'interface à cinq liens est un compromis lisible : assez abstraite pour être indépendante de l'embodiment, assez riche pour porter des gestes comme un coup de pied. Le résultat sur un second humanoïde, obtenu par simple réentraînement, suggère que l'approche se transfère. Il faut toutefois relativiser les chiffres. Les taux de 77 % et 64 % sont mesurés en simulation, dans une salle répliquée, et ne disent rien de la fiabilité sur le robot réel, qui n'est démontré que par des séquences qualitatives. Les tâches restent des démonstrations de laboratoire, loin des cadences et de la robustesse qu'exige un site industriel.
Le travail s'inscrit dans la course aux politiques corps entier pour humanoïdes. Les grands modèles VLA (Pi-0, GR00T N2, Helix) visent des compétences généralistes, tandis que les approches de suivi de mouvement par apprentissage par renforcement se sont multipliées sur le G1, plateforme académique de référence en raison de son coût relativement bas. Workhorse relève d'une troisième voie hiérarchique, avec un planificateur appris sur données humaines et un contrôleur bas niveau robuste. Il s'agit d'une publication de recherche (v1) et non d'un produit : aucun déploiement, calendrier ni partenaire industriel n'est annoncé. La suite logique serait de quantifier les taux de réussite sur matériel réel, d'élargir la diversité des tâches et d'évaluer le passage à l'échelle avec davantage de données humaines.
Dans nos dossiers



