PhysMoDPO : mouvement humanoïde physiquement plausible grâce à l'optimisation par préférences
PhysMoDPO est un cadre d'optimisation par préférences directes (DPO) publié sur arXiv en mars 2026 (version 3 révisée). Il vise à rendre les mouvements humanoïdes générés à partir de texte à la fois conformes à la physique et fidèles à l'instruction d'origine. Les méthodes actuelles génèrent un mouvement avec un modèle de diffusion entraîné sur de grandes bases de données de mouvements humains. Elles le passent ensuite dans un contrôleur du corps entier (WBC) qui le convertit en trajectoires exécutables par un personnage simulé ou un robot réel. Le WBC rend la trajectoire compatible avec la physique, mais il peut l'éloigner nettement du mouvement voulu. Les auteurs intègrent donc le WBC directement dans la boucle d'entraînement. Le modèle de diffusion est optimisé pour que la sortie du WBC, et non le mouvement brut, respecte la physique et le texte. Des récompenses physiques et spécifiques à la tâche servent à classer les trajectoires synthétisées par ordre de préférence. Les tests portent sur la génération texte-vers-mouvement et sur le contrôle spatial, avec des robots simulés, puis sur un transfert zéro-shot en simulation. Le déploiement réel se fait sur un humanoïde Unitree G1. Le résumé annonce des gains constants en réalisme physique et en métriques de tâche, mais ne publie aucun chiffre. On ne connaît donc ni l'ampleur de l'amélioration ni la taille de l'échantillon testé sur le G1.
L'intérêt tient à la manière de traiter l'écart entre le mouvement généré et le mouvement exécutable. Jusqu'ici, on corrigeait surtout ce défaut avec des heuristiques écrites à la main, comme des pénalités de glissement de pied appliquées au modèle génératif. PhysMoDPO les remplace par un signal d'apprentissage issu du contrôleur lui-même. Le générateur apprend alors ce que le WBC peut réellement suivre. Cette approche est modulaire, car elle laisse le contrôleur bas niveau en place et ajuste seulement le modèle de haut niveau. Pour un intégrateur, cela réduit le risque de voir une démonstration de mouvement séduisante se dégrader à l'exécution. Il faut toutefois rester prudent. Le G1 est la plateforme académique la plus répandue, la validation réelle semble limitée à une démonstration, et rien n'indique de robustesse sur des tâches longues ou des charges utiles. Le passage du simulateur au robot réel reste donc à confirmer à plus grande échelle.
Ces travaux s'inscrivent dans un mouvement plus large qui relie modèles génératifs de mouvement humain et contrôle du corps entier pour les humanoïdes. Le texte-vers-mouvement par diffusion a mûri sur des bases de capture humaine. En parallèle, les contrôleurs appris par renforcement en simulation sont devenus le standard pour suivre des références sur du matériel comme le G1. Les récents modèles de fondation robotiques, qui combinent vision, langage et action, cherchent le même objectif par une autre voie, celle de politiques apprises de bout en bout. PhysMoDPO relève de l'approche hiérarchique : un générateur de mouvement au-dessus d'un contrôleur de suivi. La suite logique consiste à publier les chiffres détaillés, à tester d'autres robots et d'autres WBC, et à évaluer la méthode sur des mouvements plus dynamiques ou en interaction avec l'environnement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




