
Whole-Body UMI : transfère les compétences de manipulation aux humanoïdes par génération de mouvement en temps réel
Un article publié le 22 septembre 2026 sur arXiv (2609.22829) présente Whole-Body UMI (WB-UMI), une méthode qui étend l'Universal Manipulation Interface (UMI), protocole de collecte de démonstrations par préhenseur portatif qui évite la téléopération, au contrôle corps entier des robots humanoïdes. Le système ajoute un générateur de mouvement temps réel conditionné par la position de l'effecteur, entraîné séparément sur des données de capture de mouvement retargetées, sans capteurs corporels ni démonstrations appariées. En déploiement, une architecture asynchrone combine une politique de diffusion apprise sur les démonstrations UMI natives, ce générateur de mouvement et un contrôleur corps entier avec compensation de latence. Testée sur le robot G1 d'Unitree, l'approche atteint 90% de réussite pour fermer un tiroir, 80% pour un pick-and-place sur étagère, 40% pour une tâche combinant déplacement et prise (Loco-PnP), et 30% pour un lancer de balle.
Cet écart de performance, de 90% à 30% selon les tâches, montre que le transfert de compétences captées à la main vers un contrôle corps entier reste partiel, les mouvements dynamiques comme le lancer restant nettement plus difficiles que des gestes quasi-statiques. Pour l'industrie humanoïde, l'enjeu dépasse la démonstration technique : la téléopération demeure le principal goulot d'étranglement pour entraîner des politiques vision-language-action sur des robots à jambes, et découpler l'apprentissage de la coordination corps entier de celui de la sémantique de tâche réduirait la dépendance à des données coûteuses capturées directement sur le robot. Le travail teste ainsi, en boucle fermée sur robot réel, l'hypothèse qu'une interface de collecte générique comme UMI peut s'étendre aux humanoïdes sans instrumentation corporelle supplémentaire.
UMI avait été conçu comme un outil de collecte à bas coût pour l'apprentissage de politiques de manipulation, via un préhenseur instrumenté plutôt qu'un robot téléopéré. WB-UMI s'inscrit dans une compétition plus large de modèles vision-language-action et d'architectures de contrôle humanoïde, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent toutes à réduire le coût de la collecte de données réelles. Contrairement à ces initiatives industrielles, WB-UMI reste une contribution académique en preprint, validée sur quatre tâches avec un seul robot, le G1 d'Unitree, sans partenaire annoncé ni calendrier de déploiement.
Dans nos dossiers




