
RobotDancing : l'apprentissage par renforcement à action résiduelle permet un suivi robuste des mouvements humanoïdes sur le long terme
Des chercheurs présentent RobotDancing, une méthode d'apprentissage par renforcement en une seule étape pour faire exécuter à des robots humanoïdes des mouvements de danse longs et dynamiquement exigeants, avec une robustesse accrue face aux erreurs d'accumulation. Le principe : plutôt que de demander à la politique de recréer entièrement un mouvement de référence retargeté (transposé depuis une capture humaine vers la cinématique du robot), RobotDancing prédit des corrections résiduelles sur les cibles articulaires. La politique se concentre ainsi sur la compensation des écarts dynamiques entre la référence et le robot réel (limites d'actionneurs, latence, friction, inertie) plutôt que sur la resynthèse complète du geste. Une politique est entraînée par séquence de référence, avec une recette d'entraînement et de déploiement commune réutilisée entre mouvements et plateformes. L'équipe a évalué la méthode sur huit chorégraphies issues du jeu de données LAFAN1, exécutées sur le robot Unitree G1, avec des expériences complémentaires de transfert inter-plateforme sur les Unitree H1 et H1-2.
Le problème ciblé est central dans la robotique humanoïde actuelle : les mouvements retargetés depuis des captures humaines sont cinématiquement plausibles mais dynamiquement incohérents avec le robot réel, ce qui fait dériver le suivi de trajectoire sur les séquences longues et finit par déstabiliser le contrôleur. En montrant des politiques G1 capables d'exécuter des comportements longs et énergétiques directement sur matériel, sans ajustement au moment du test, RobotDancing apporte un signal concret sur la viabilité du transfert simulation-vers-réel pour du contrôle whole-body à haute dynamique, un point souvent démontré en vidéo mais rarement quantifié avec rigueur dans la littérature.
Le travail s'inscrit dans la lignée des méthodes de motion tracking par RL pour humanoïdes, où LAFAN1 sert de banc d'essai de référence pour les mouvements complexes. La publication, une version révisée sur arXiv (2509.20717v2), inclut des clips qualitatifs sur H1 et H1-2 pour illustrer la généralisation inter-plateforme, sans toutefois fournir de métriques chiffrées équivalentes à celles obtenues sur le G1, ce qui invite à la prudence sur l'ampleur réelle du transfert démontré.
Dans nos dossiers




