Aller au contenu principal
Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines
RecherchearXiv cs.RO 

Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Workhorse, un système qui apprend la loco-manipulation du corps entier pour humanoïdes à partir de démonstrations humaines enregistrées sans robot (arXiv 2610.09117). L'architecture sépare deux politiques. Un planificateur visuel, alimenté par des images RGB égocentriques et la proprioception, prédit cinq cibles de liens : le torse, les deux poignets et les deux pieds. Un contrôleur de suivi du corps entier, entraîné par apprentissage par renforcement, exécute ensuite ces poses sur le robot. Les deux politiques sont entraînées séparément sur les mêmes poses humaines, sans retargeting vers la morphologie du robot. Chacune est aussi entraînée sur des données augmentées qui imitent les erreurs de l'autre au déploiement. Sur un Unitree G1 réel, le système trie des boîtes avec les mains et un coup de pied, attrape une boîte lancée, puis fait basculer une valise et grimpe dessus. Il récupère aussi après une poussée ou le retrait de la boîte par une personne. Dans une copie simulée de la salle de démonstration, le tri aboutit dans 77 % des épisodes, et dans 64 % sous poussées de 40 N.s. Avec les deux politiques réentraînées sur les mêmes démonstrations, un second humanoïde simulé atteint 83 % sans poussées.

L'intérêt tient à la façon de contourner deux goulets d'étranglement. Les humanoïdes peinent à planifier des manipulations riches en contacts, où le corps entier participe, à partir de la seule vision embarquée. Et la téléopération robot, qui produit l'essentiel des données d'entraînement actuelles, coûte cher et passe mal à l'échelle. Utiliser des démonstrations humaines brutes, sans passer par le retargeting, simplifie la collecte et ouvre la voie à des corpus plus larges. L'interface à cinq liens est un compromis lisible : assez abstraite pour être indépendante de l'embodiment, assez riche pour porter des gestes comme un coup de pied. Le résultat sur un second humanoïde, obtenu par simple réentraînement, suggère que l'approche se transfère. Il faut toutefois relativiser les chiffres. Les taux de 77 % et 64 % sont mesurés en simulation, dans une salle répliquée, et ne disent rien de la fiabilité sur le robot réel, qui n'est démontré que par des séquences qualitatives. Les tâches restent des démonstrations de laboratoire, loin des cadences et de la robustesse qu'exige un site industriel.

Le travail s'inscrit dans la course aux politiques corps entier pour humanoïdes. Les grands modèles VLA (Pi-0, GR00T N2, Helix) visent des compétences généralistes, tandis que les approches de suivi de mouvement par apprentissage par renforcement se sont multipliées sur le G1, plateforme académique de référence en raison de son coût relativement bas. Workhorse relève d'une troisième voie hiérarchique, avec un planificateur appris sur données humaines et un contrôleur bas niveau robuste. Il s'agit d'une publication de recherche (v1) et non d'un produit : aucun déploiement, calendrier ni partenaire industriel n'est annoncé. La suite logique serait de quantifier les taux de réussite sur matériel réel, d'élargir la diversité des tâches et d'évaluer le passage à l'échelle avec davantage de données humaines.

À lire aussi

1arXiv cs.RO 

HULK : apprendre la locomanipulation de force du corps entier pour les robots humanoïdes

Des chercheurs ont publié sur arXiv (octobre 2026) HULK, un cadre de contrôle du corps entier destiné à la manipulation locomotrice « avec force » sur robots humanoïdes, c'est-à-dire le transport d'objets volumineux et lourds. Le principe repose sur une commande prédictive (MPC) qui guide l'apprentissage par renforcement grâce à des prédictions de la dynamique en charge. Deux politiques « enseignantes » sont entraînées : l'une suit des mouvements de bras sous forces appliquées aux poignets, l'autre marche en tenant un grand objet plaqué contre le corps. Une fonction barrière de contrôle fondée sur le « capture point » vient renforcer l'enseignante des poignets pendant l'entraînement pour préserver l'équilibre sous charge. Les deux enseignantes sont ensuite distillées en une seule politique. L'évaluation couvre la simulation et le Unitree G1. En simulation, l'enseignante dotée de la barrière affiche les erreurs de suivi de vitesse avant et latérale les plus faibles parmi les contrôleurs comparés, à 10 kg par bras, et réduit de 35,7 % l'excursion agrégée du mouvement divergent (DCM) par rapport au seul apprentissage guidé par MPC. Elle résiste à des poussées sur le torse allant jusqu'à 130 N. L'intérêt tient au problème ciblé. La plupart des politiques de locomotion apprises pour humanoïdes sont entraînées à vide ou avec des charges légères, alors que les usages logistiques et industriels impliquent des caisses, bacs ou cartons qui déplacent le centre de masse et imposent un effort soutenu sur tout le haut du corps. En injectant la dynamique chargée dans l'entraînement, HULK s'attaque à l'un des écarts entre démonstrations et exploitation réelle. Le chiffre de 10 kg par bras reste toutefois à relativiser : il est obtenu en simulation, sur une plateforme G1 de taille et de puissance modestes, et l'article ne fournit, dans ce résumé, ni temps de cycle, ni taux de réussite sur matériel, ni durée de port. La réduction de 35,7 % du DCM est un gain relatif entre variantes de la même méthode, pas une performance absolue. La preuve d'une robustesse en conditions réelles, avec des objets variés et des sols imparfaits, reste à faire. HULK s'inscrit dans la vague des approches « teacher-student » et de contrôle du corps entier par apprentissage, déjà largement testées sur le G1 pour la marche, le saut ou les mouvements expressifs, et dans la recherche de bases communes entre MPC, qui apporte des garanties physiques, et RL, qui apporte la robustesse. Les acteurs industriels, dont Figure, Tesla avec Optimus et Agility, visent des charges utiles plus élevées sur des machines propriétaires, sans publier leurs méthodes de contrôle. Ici, il s'agit d'une contribution académique, sans produit ni pilote annoncé. La suite logique serait un transfert sur des humanoïdes plus grands et des charges réelles plus lourdes, avec des mesures publiées sur matériel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain
2arXiv cs.RO 

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain

Des chercheurs publient EgoHumanoid-V2 (arXiv 2609.37181), un cadre de transfert de compétences d'un humain vers un robot humanoïde à partir de vidéos égocentriques, c'est-à-dire filmées depuis le point de vue de l'opérateur. Il vise la loco-manipulation coordonnée du corps entier, où la marche et l'usage des bras sont planifiés ensemble. Son cœur est un alignement d'actions « du grossier au fin ». Une première étape corrige la référence cinématique. Une seconde affine le résultat en tenant compte de la dynamique, ce qui améliore la précision de pose de l'effecteur final tout en préservant la coordination corps entier. Pour réduire l'écart visuel entre l'humain et le robot, l'équipe ajoute un rendu du bras robotique dans les images humaines, ainsi qu'une augmentation d'images à l'entraînement pour gagner en robustesse au changement de point de vue. Sur quatre tâches réelles, des politiques VLA (vision-langage-action) entraînées sur ces données humaines alignées réalisent un transfert « zéro-shot », sans aucune démonstration robot sur la tâche cible. Les scores sont annoncés comme comparables à ceux de politiques entraînées par téléopération, pour un coût de collecte plus faible. Le résumé ne donne ni le robot utilisé, ni le nombre de démonstrations, ni le coût chiffré. L'enjeu est d'abord économique. La téléopération reste le principal goulot d'étranglement des politiques humanoïdes : elle exige des robots, des opérateurs formés et du temps machine, et ses volumes plafonnent bien en dessous de ce que réclame un modèle généraliste. Filmer des humains est bien moins cher et couvre une diversité de scènes que aucun parc de robots ne peut reproduire. Si le résultat se confirme, il indique que la donnée humaine peut servir de supervision directe de compétences, et non plus seulement de préentraînement de la perception. Pour un intégrateur, cela ouvrirait la voie à des compétences apprises sur site sans mobiliser de robot. Il faut toutefois rester prudent : quatre tâches, une comparaison « comparable » sans écart chiffré dans le résumé, et un article en version préliminaire (v1) qui n'a pas passé de relecture par les pairs. Rien ne dit non plus que ces scores tiennent hors du laboratoire, sur des cadences industrielles. Ce travail prolonge une première génération de méthodes égocentriques qui misait surtout sur la généralisation de scènes, avec un contrôle découplé entre locomotion et manipulation, ce qui laissait de côté les compétences corps entier coordonnées. Il s'inscrit dans une course plus large à la donnée humaine : les grands acteurs des modèles fondation humanoïdes, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0, cherchent tous à réduire leur dépendance à la téléopération, par la simulation, la vidéo humaine ou les deux. Aucun déploiement ni calendrier commercial n'est annoncé ici, il s'agit d'une contribution de recherche. La suite logique serait un test sur davantage de tâches et de morphologies, avec des comparaisons chiffrées de coût et de performance face à la téléopération.

RecherchePaper
1 source
HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines
3arXiv cs.RO 

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines

Une équipe de chercheurs a publié sur arXiv (arXiv:2603.03243v2) HoMMI, pour Whole-Body Mobile Manipulation Interface, un framework d'apprentissage par imitation permettant à un robot mobile de maîtriser la manipulation bimanuelle et la navigation à partir de démonstrations humaines réalisées sans robot. Le principe : un opérateur humain porte une interface portative héritée du projet UMI (Universal Manipulation Interface), enrichie d'une caméra égocentrique capturant le contexte global de la scène (position dans l'espace, état de l'environnement). Ces données brutes alimentent une politique apprise, transférée ensuite sur un robot à corps entier (bras, torse, base mobile) sans que celui-ci n'ait été présent lors de la collecte. La difficulté centrale que HoMMI cherche à résoudre est l'"embodiment gap" : la différence morphologique et sensorielle entre humain et robot rend le transfert de politique difficile, particulièrement en perception égocentrique où les champs de vue et hauteurs d'oeil divergent fortement. Les auteurs proposent trois briques techniques pour combler cet écart : une représentation visuelle agnostique à l'embodiment, une représentation d'action "head relaxed" qui neutralise les variations de mouvement de tête, et un contrôleur corps entier réalisant les trajectoires main-oeil sous contraintes physiques du robot. Ces choix permettent des tâches longue-séquence mobilisant navigation, perception active et coordination bimanuelle, le type de scénario que les architectures Vision-Language-Action (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA visent également à résoudre. Les résultats, présentés sous forme de vidéos sur hommi-robot.github.io, restent à valider en conditions non contrôlées et sur des benchmarks standardisés. HoMMI s'inscrit dans la continuité directe du projet UMI (Columbia/Stanford, 2024), qui avait popularisé la collecte portable de démonstrations pour la manipulation fixe sur table. L'extension au robot mobile ajoute la dimension navigation, saut de complexité majeur pour le sim-to-real et la généralisation hors laboratoire. Les approches concurrentes incluent Mobile ALOHA (Stanford), les pipelines de distillation de données de Physical Intelligence, et les travaux de manipulation bimanuelle ALOHA/ACT de Berkeley. HoMMI reste à ce stade un preprint arXiv sans déploiement industriel annoncé ni métriques de taux de succès publiées, une limite habituelle des publications en robotique d'apprentissage avant revue par les pairs.

RecherchePaper
1 source
Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet
4arXiv cs.RO 

Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet

Une équipe de recherche publie sur arXiv, le 16 septembre 2026 (arXiv:2609.16683), Weave, un framework pour apprendre à des robots humanoïdes la loco-manipulation dextre en corps entier à partir de démonstrations humaines capturées. Ces interactions humain-objet sont converties en références exécutables par le robot via un retargeting sensible aux contacts et une complétion du mouvement d'approche. Une politique consciente des contacts et de la géométrie commande ensuite simultanément 29 articulations corporelles et 12 articulations de doigts actionnées, sur plusieurs objets et séquences d'interaction. Sur neuf objets testés, le taux de réussite atteint 92,5 % pour les interactions entraînées et 65,0 % pour des séquences totalement inédites, sans entraînement supplémentaire. Les auteurs publient aussi environ 9 000 exécutions physiques réelles, soit près de 23 heures de trajectoires robot-objet annotées en contacts. Coordonner équilibre, locomotion et contact dextre des doigts reste l'un des obstacles majeurs pour faire passer les humanoïdes de la démonstration scriptée à la manipulation réelle d'objets variés, un enjeu direct pour les intégrateurs visant l'entrepôt ou l'usine. En retargetant des captures de mouvement humain vers l'embodiment du robot, Weave s'attaque frontalement au fossé entre démonstration et contrôle réel. Le score de 65 % sur des séquences jamais vues, même limité à neuf objets, suggère que la politique apprend des primitives de contact réutilisables plutôt que de simples trajectoires mémorisées, une distinction clé face aux démonstrations vidéo soigneusement sélectionnées courantes dans le secteur. Le jeu de données publié constitue par ailleurs une ressource comparable, dans son esprit, aux corpus servant à entraîner des modèles vision-langage-action comme Pi-0 ou GR00T N2. Il s'agit d'un travail de recherche en preprint, sans partenaire industriel ni plateforme robotique nommée dans le résumé, pas encore relu par les pairs : une démonstration de laboratoire, non un produit déployé ni un pilote commercial. Weave s'inscrit dans la vague de recherches sur l'apprentissage par imitation à partir de capture de mouvement humain, aux côtés d'initiatives comme Helix chez Figure ou les politiques de Physical Intelligence, qui visent toutes à résoudre le transfert humain-vers-robot pour la manipulation dextre. Aucun calendrier de déploiement n'est annoncé ; la suite logique, ouverte par la publication du jeu de données, est son adoption par d'autres équipes pour entraîner ou évaluer leurs propres politiques d'interaction, plutôt qu'un lancement produit à court terme.

RecherchePaper
1 source