
Robots humanoïdes : ramper, roue et backflips maîtrisés grâce aux données de mouvement et d'animation

Des chercheurs du RAI Institute et de Boston Dynamics ont développé ZEST (Zero-shot Embodied Skill Transfer), un framework d'apprentissage par renforcement permettant à des robots à pattes d'acquérir des mouvements agiles à partir de données de mouvement humain, en une seule phase d'entraînement plutôt qu'un réglage par tâche. Le système apprend depuis trois sources : capture de mouvement haute fidélité, vidéo simple caméra, et animation par images clés, converties en commandes robotiques par retargeting cinématique. Testé sur l'humanoïde Atlas et le quadrupède Spot de Boston Dynamics ainsi que sur le G1 d'Unitree, ZEST a reproduit des mouvements tels que reptation au sol, roulades avant, roue, breakdance, danse, tirs au but et escalade de caisses, plus un salto arrière continu et un tonneau pour Spot à partir de données d'animation. Chaque politique de contrôle a nécessité environ 10 heures d'entraînement, soit près de 7 000 itérations, sur un seul GPU NVIDIA L4, entraînée entièrement en simulation puis transférée sur le matériel réel sans réglage supplémentaire, en s'appuyant uniquement sur des capteurs proprioceptifs embarqués à l'exécution.
Pour l'industrie robotique, l'intérêt tient à ce que ZEST élimine plusieurs briques habituelles des pipelines de contrôle : estimateurs d'état, longs historiques d'observation, fenêtres de référence future, calendriers de contact au sol et ingénierie poussée de récompenses propres à chaque tâche. Cela réduit potentiellement le travail d'ingénierie et de réglage requis pour chaque nouvelle compétence, un goulot d'étranglement connu du déploiement de robots humanoïdes et quadrupèdes. Le transfert réussi d'une même architecture entre un humanoïde et un quadrupède illustre une portabilité inter-morphologies rarement démontrée à ce niveau d'agilité. L'équipe reste toutefois prudente : le système n'a été validé que sur sols plats et non glissants, sans généralisation démontrée à des mouvements totalement inédits. Il s'agit donc d'une avancée de recherche publiée sous forme d'étude, avec des démonstrations en environnement contrôlé, et non d'un produit commercial déployé ou d'un pilote industriel annoncé.
ZEST s'inscrit dans les travaux du RAI Institute, laboratoire de recherche lié à Boston Dynamics et centré sur le contrôle et l'apprentissage pour robots à pattes, prolongeant des efforts visant à réduire la dépendance à l'ingénierie manuelle des contrôleurs. Le framework se positionne différemment des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, qui ciblent surtout la manipulation : ZEST vise l'agilité locomotrice et les mouvements corporels complets, du crawl militaire au salto arrière. Il ne nécessite pas d'annotations explicites de contact au sol, ce qui allège la préparation des données de démonstration. Les auteurs indiquent que les prochaines étapes porteront sur l'adaptation zero-shot et few-shot ainsi que sur l'apprentissage continu, sans calendrier ni partenaire de déploiement précisés à ce stade.
Dans nos dossiers




