
Échantillonner, simuler, sélectionner : le pilotage par la physique pour le texte-vers-mouvement des humanoïdes sans entraînement
Une équipe de recherche présente S³ (Sample-Simulate-Select), une méthode permettant à un humanoïde d'exécuter des commandes textuelles sans aucun entraînement supplémentaire, en plaçant directement le contrôleur de déploiement dans la boucle de génération. Pour chaque instruction, S³ tire N mouvements candidats d'un modèle text-to-motion figé, les retargete vers un robot Unitree G1 par cinématique inverse à correspondance de direction, les simule sous dynamique rigide complète avec la politique de suivi préentraînée SONIC, puis conserve le candidat le mieux exécuté. Sur 200 prompts stratifiés issus de HumanML3D, avec huit candidats par instruction, le taux d'exécution en position debout passe de 83,5% à 89,5%, et les passages du filtre matériel bondissent de 33 à 85 sur 200 ; sur l'intégralité du split de test (4184 prompts), le taux grimpe de 80,5% à 89,5%. Un vérificateur cinématique, prédisant les chutes avec une AUROC de 0,90, ne récupère qu'un quart de ce gain. Une comparaison avec un second retargeteur, GMR, révèle des échecs complémentaires qui portent le plafond combiné à 95%, et les 177 clips sélectionnés puis exécutés sur un G1 réel se terminent tous debout, avec une erreur de suivi proche de la simulation (r=0,94).
L'intérêt tient à ce que ces gains s'obtiennent sans réentraîner ni le générateur ni le contrôleur, alors que les systèmes récents reliant langage et humanoïdes comblent généralement cet écart par un entraînement dédié. Pour les équipes de recherche appliquée et les intégrateurs, cela suggère qu'un simple filtrage physique par simulation, réutilisant des briques déjà déployées, peut constituer une étape low-cost avant d'investir dans du réentraînement. Le travail tempère toutefois l'enthousiasme : le taux de passage du filtre matériel plafonne à 42,5%, et une classe entière de mouvements, ceux qui abaissent le bassin, échappe totalement à la sélection car aucun candidat généré ne l'exécute correctement.
La méthode s'appuie sur des générateurs text-to-motion entraînés sur HumanML3D et sur la politique de suivi corps-entier SONIC, ici testée sur un Unitree G1, et se positionne explicitement contre l'approche dominante d'un entraînement de bout en bout langage-vers-humanoïde. Il s'agit d'une contribution de recherche, validée à grande échelle en simulation mais sur un nombre restreint de séquences réelles et un seul robot, sans annonce de déploiement commercial ; les auteurs pointent eux-mêmes la limite à lever, les mouvements abaissant le centre de masse, qui exigeront probablement un générateur réentraîné sur des trajectoires robot plutôt qu'une sélection parmi des candidats humains retargetés.
Dans nos dossiers




