Aller au contenu principal
RecherchearXiv cs.RO 

HULK : apprendre la locomanipulation de force du corps entier pour les robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (octobre 2026) HULK, un cadre de contrôle du corps entier destiné à la manipulation locomotrice « avec force » sur robots humanoïdes, c'est-à-dire le transport d'objets volumineux et lourds. Le principe repose sur une commande prédictive (MPC) qui guide l'apprentissage par renforcement grâce à des prédictions de la dynamique en charge. Deux politiques « enseignantes » sont entraînées : l'une suit des mouvements de bras sous forces appliquées aux poignets, l'autre marche en tenant un grand objet plaqué contre le corps. Une fonction barrière de contrôle fondée sur le « capture point » vient renforcer l'enseignante des poignets pendant l'entraînement pour préserver l'équilibre sous charge. Les deux enseignantes sont ensuite distillées en une seule politique. L'évaluation couvre la simulation et le Unitree G1. En simulation, l'enseignante dotée de la barrière affiche les erreurs de suivi de vitesse avant et latérale les plus faibles parmi les contrôleurs comparés, à 10 kg par bras, et réduit de 35,7 % l'excursion agrégée du mouvement divergent (DCM) par rapport au seul apprentissage guidé par MPC. Elle résiste à des poussées sur le torse allant jusqu'à 130 N.

L'intérêt tient au problème ciblé. La plupart des politiques de locomotion apprises pour humanoïdes sont entraînées à vide ou avec des charges légères, alors que les usages logistiques et industriels impliquent des caisses, bacs ou cartons qui déplacent le centre de masse et imposent un effort soutenu sur tout le haut du corps. En injectant la dynamique chargée dans l'entraînement, HULK s'attaque à l'un des écarts entre démonstrations et exploitation réelle. Le chiffre de 10 kg par bras reste toutefois à relativiser : il est obtenu en simulation, sur une plateforme G1 de taille et de puissance modestes, et l'article ne fournit, dans ce résumé, ni temps de cycle, ni taux de réussite sur matériel, ni durée de port. La réduction de 35,7 % du DCM est un gain relatif entre variantes de la même méthode, pas une performance absolue. La preuve d'une robustesse en conditions réelles, avec des objets variés et des sols imparfaits, reste à faire.

HULK s'inscrit dans la vague des approches « teacher-student » et de contrôle du corps entier par apprentissage, déjà largement testées sur le G1 pour la marche, le saut ou les mouvements expressifs, et dans la recherche de bases communes entre MPC, qui apporte des garanties physiques, et RL, qui apporte la robustesse. Les acteurs industriels, dont Figure, Tesla avec Optimus et Agility, visent des charges utiles plus élevées sur des machines propriétaires, sans publier leurs méthodes de contrôle. Ici, il s'agit d'une contribution académique, sans produit ni pilote annoncé. La suite logique serait un transfert sur des humanoïdes plus grands et des charges réelles plus lourdes, avec des mesures publiées sur matériel.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
1arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes
2arXiv cs.RO 

ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes

Le laboratoire à l'origine du projet ViLoMan, publié en preprint sur arXiv (arXiv:2609.19340, soumission anonyme en relecture en double aveugle, page projet viloman-anonymous.pages.dev), présente un système d'apprentissage pour la loco-manipulation autonome des robots humanoïdes. La méthode transforme des démonstrations humaines partielles, capturées de façon cinématique lors d'interactions homme-objet, en trajectoires robotiques complètes et physiquement exécutables. Ces trajectoires alimentent ensuite un entraînement par distillation enseignant-élève, qui produit une politique unique convertissant des observations de profondeur en vision égocentrique et des mesures proprioceptives directement en commandes articulaires pour l'ensemble du corps. Une fois déployée, cette politique ne nécessite ni mouvement de référence ni commande intermédiaire. Les auteurs l'ont testée sur des tâches de fermeture de porte, avec des configurations de porte et des positions de départ variées, en simulation puis sur un robot réel Unitree G1, montrant qu'une seule politique suffit à accomplir la tâche uniquement à partir des capteurs embarqués. Ce travail s'attaque à deux obstacles centraux du secteur : la rareté de données d'interaction robot-objet physiquement réalisables, et la difficulté d'apprendre un contrôle unifié du corps entier à partir des seules observations embarquées, sans capture de mouvement externe ni téléopération lourde. En démontrant un transfert simulation-réel fonctionnel avec un capteur de profondeur et la proprioception seuls, l'étude apporte un contre-exemple concret à l'hypothèse selon laquelle les politiques de loco-manipulation humanoïde exigent nécessairement de vastes jeux de données téléopérées coûteux à constituer. Pour les intégrateurs et décideurs robotique, l'intérêt réside surtout dans la méthode de conversion des démonstrations humaines en données d'entraînement robot exploitables, une piste alternative aux pipelines de collecte par téléopération utilisés par des acteurs comme Figure ou Physical Intelligence. ViLoMan s'inscrit dans la compétition croissante autour des politiques vision-langage-action et des architectures de contrôle whole-body pour humanoïdes, aux côtés d'approches commerciales comme Helix de Figure, GR00T N2 de Nvidia ou Pi-0 de Physical Intelligence, qui reposent largement sur des données de téléopération à grande échelle. Ici, l'origine académique et le statut anonyme de la soumission signalent une contribution de recherche encore au stade du laboratoire, validée sur une seule tâche restreinte de fermeture de porte plutôt que déployée en conditions industrielles. Les prochaines étapes attendues concernent l'extension à d'autres tâches de manipulation et à des environnements plus variés avant toute perspective de déploiement réel.

RecherchePaper
1 source
Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines
3arXiv cs.RO 

Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines

Des chercheurs présentent Workhorse, un système qui apprend la loco-manipulation du corps entier pour humanoïdes à partir de démonstrations humaines enregistrées sans robot (arXiv 2610.09117). L'architecture sépare deux politiques. Un planificateur visuel, alimenté par des images RGB égocentriques et la proprioception, prédit cinq cibles de liens : le torse, les deux poignets et les deux pieds. Un contrôleur de suivi du corps entier, entraîné par apprentissage par renforcement, exécute ensuite ces poses sur le robot. Les deux politiques sont entraînées séparément sur les mêmes poses humaines, sans retargeting vers la morphologie du robot. Chacune est aussi entraînée sur des données augmentées qui imitent les erreurs de l'autre au déploiement. Sur un Unitree G1 réel, le système trie des boîtes avec les mains et un coup de pied, attrape une boîte lancée, puis fait basculer une valise et grimpe dessus. Il récupère aussi après une poussée ou le retrait de la boîte par une personne. Dans une copie simulée de la salle de démonstration, le tri aboutit dans 77 % des épisodes, et dans 64 % sous poussées de 40 N.s. Avec les deux politiques réentraînées sur les mêmes démonstrations, un second humanoïde simulé atteint 83 % sans poussées. L'intérêt tient à la façon de contourner deux goulets d'étranglement. Les humanoïdes peinent à planifier des manipulations riches en contacts, où le corps entier participe, à partir de la seule vision embarquée. Et la téléopération robot, qui produit l'essentiel des données d'entraînement actuelles, coûte cher et passe mal à l'échelle. Utiliser des démonstrations humaines brutes, sans passer par le retargeting, simplifie la collecte et ouvre la voie à des corpus plus larges. L'interface à cinq liens est un compromis lisible : assez abstraite pour être indépendante de l'embodiment, assez riche pour porter des gestes comme un coup de pied. Le résultat sur un second humanoïde, obtenu par simple réentraînement, suggère que l'approche se transfère. Il faut toutefois relativiser les chiffres. Les taux de 77 % et 64 % sont mesurés en simulation, dans une salle répliquée, et ne disent rien de la fiabilité sur le robot réel, qui n'est démontré que par des séquences qualitatives. Les tâches restent des démonstrations de laboratoire, loin des cadences et de la robustesse qu'exige un site industriel. Le travail s'inscrit dans la course aux politiques corps entier pour humanoïdes. Les grands modèles VLA (Pi-0, GR00T N2, Helix) visent des compétences généralistes, tandis que les approches de suivi de mouvement par apprentissage par renforcement se sont multipliées sur le G1, plateforme académique de référence en raison de son coût relativement bas. Workhorse relève d'une troisième voie hiérarchique, avec un planificateur appris sur données humaines et un contrôleur bas niveau robuste. Il s'agit d'une publication de recherche (v1) et non d'un produit : aucun déploiement, calendrier ni partenaire industriel n'est annoncé. La suite logique serait de quantifier les taux de réussite sur matériel réel, d'élargir la diversité des tâches et d'évaluer le passage à l'échelle avec davantage de données humaines.

RecherchePaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
4arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source