Aller au contenu principal
RecherchearXiv cs.RO 

PhysMoDPO : mouvement humanoïde physiquement plausible grâce à l'optimisation par préférences

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PhysMoDPO est un cadre d'optimisation par préférences directes (DPO) publié sur arXiv en mars 2026 (version 3 révisée). Il vise à rendre les mouvements humanoïdes générés à partir de texte à la fois conformes à la physique et fidèles à l'instruction d'origine. Les méthodes actuelles génèrent un mouvement avec un modèle de diffusion entraîné sur de grandes bases de données de mouvements humains. Elles le passent ensuite dans un contrôleur du corps entier (WBC) qui le convertit en trajectoires exécutables par un personnage simulé ou un robot réel. Le WBC rend la trajectoire compatible avec la physique, mais il peut l'éloigner nettement du mouvement voulu. Les auteurs intègrent donc le WBC directement dans la boucle d'entraînement. Le modèle de diffusion est optimisé pour que la sortie du WBC, et non le mouvement brut, respecte la physique et le texte. Des récompenses physiques et spécifiques à la tâche servent à classer les trajectoires synthétisées par ordre de préférence. Les tests portent sur la génération texte-vers-mouvement et sur le contrôle spatial, avec des robots simulés, puis sur un transfert zéro-shot en simulation. Le déploiement réel se fait sur un humanoïde Unitree G1. Le résumé annonce des gains constants en réalisme physique et en métriques de tâche, mais ne publie aucun chiffre. On ne connaît donc ni l'ampleur de l'amélioration ni la taille de l'échantillon testé sur le G1.

L'intérêt tient à la manière de traiter l'écart entre le mouvement généré et le mouvement exécutable. Jusqu'ici, on corrigeait surtout ce défaut avec des heuristiques écrites à la main, comme des pénalités de glissement de pied appliquées au modèle génératif. PhysMoDPO les remplace par un signal d'apprentissage issu du contrôleur lui-même. Le générateur apprend alors ce que le WBC peut réellement suivre. Cette approche est modulaire, car elle laisse le contrôleur bas niveau en place et ajuste seulement le modèle de haut niveau. Pour un intégrateur, cela réduit le risque de voir une démonstration de mouvement séduisante se dégrader à l'exécution. Il faut toutefois rester prudent. Le G1 est la plateforme académique la plus répandue, la validation réelle semble limitée à une démonstration, et rien n'indique de robustesse sur des tâches longues ou des charges utiles. Le passage du simulateur au robot réel reste donc à confirmer à plus grande échelle.

Ces travaux s'inscrivent dans un mouvement plus large qui relie modèles génératifs de mouvement humain et contrôle du corps entier pour les humanoïdes. Le texte-vers-mouvement par diffusion a mûri sur des bases de capture humaine. En parallèle, les contrôleurs appris par renforcement en simulation sont devenus le standard pour suivre des références sur du matériel comme le G1. Les récents modèles de fondation robotiques, qui combinent vision, langage et action, cherchent le même objectif par une autre voie, celle de politiques apprises de bout en bout. PhysMoDPO relève de l'approche hiérarchique : un générateur de mouvement au-dessus d'un contrôleur de suivi. La suite logique consiste à publier les chiffres détaillés, à tester d'autres robots et d'autres WBC, et à évaluer la méthode sur des mouvements plus dynamiques ou en interaction avec l'environnement.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Collaboration en peinture humain-robot combinant optimisation par préférences et primitives de mouvement dynamiques
1arXiv cs.RO 

Collaboration en peinture humain-robot combinant optimisation par préférences et primitives de mouvement dynamiques

Des chercheurs présentent un système de peinture collaborative homme-robot combinant optimisation par préférences et primitives de mouvement dynamiques, décrit dans une publication arXiv (2608.01981v1). L'idée centrale : un robot assiste un opérateur humain pendant une tâche de peinture en ajustant en temps réel l'orientation de la pièce travaillée pour suivre celle de la main de l'opérateur. Le réglage des paramètres de contrôle, le temps d'exécution, la réactivité du robot et l'amplification de rotation, repose sur l'algorithme GLISp, une méthode d'optimisation par préférences (PBO) qui apprend directement du retour humain plutôt que d'une fonction de récompense prédéfinie. Les primitives de mouvement dynamiques (DMP), technique classique de génération de trajectoires en robotique, ont été modifiées pour rendre le comportement du robot plus réactif et mieux adapté aux contraintes ergonomiques. Le système a été testé avec un groupe hétérogène de participants réalisant des tâches de peinture réelles, avec des résultats montrant une réduction de l'effort perçu par l'opérateur et une amélioration des résultats du processus. L'intérêt de ce travail dépasse la seule peinture industrielle : il illustre une approche de calibration de robots collaboratifs qui évite le réglage manuel fastidieux des paramètres de comportement, un problème récurrent en cobotique. En laissant l'humain guider l'apprentissage par préférences successives plutôt qu'en programmant des règles fixes, le système s'adapte à la morphologie et au style de chaque opérateur sans reprogrammation. Pour les intégrateurs et décideurs industriels, cela ouvre une piste vers des postes de travail hybrides où le robot compense la charge physique sans remplacer le geste humain, particulièrement pertinent dans les tâches de finition, peinture, ponçage, polissage, où la dextérité humaine reste difficile à automatiser entièrement. Ce travail s'inscrit dans un courant de recherche plus large sur l'apprentissage par préférences appliqué à la robotique collaborative, où les DMP servent depuis longtemps de brique standard pour générer des trajectoires adaptatives. Il s'agit ici d'une contribution académique de validation expérimentale plutôt que d'un produit commercialisé : aucune entreprise ni site de déploiement industriel n'est mentionné, l'évaluation se limitant à un groupe de participants en conditions contrôlées. Les prochaines étapes attendues porteraient sur l'extension de la méthode à d'autres tâches manuelles assistées et sur des essais à plus grande échelle.

RecherchePaper
1 source
Optimisation par entropie croisée de plans de tâches et de mouvements à ancrage physique
2arXiv cs.RO 

Optimisation par entropie croisée de plans de tâches et de mouvements à ancrage physique

Une équipe de recherche a publié sur arXiv (réf. 2512.11571) une méthode de planification de tâches et de mouvements (TAMP) qui intègre un simulateur physique parallélisé sur GPU et une optimisation par entropie croisée. Le système planifie simultanément les actions discrètes à haut niveau et les trajectoires continues à bas niveau, en tenant compte explicitement des dynamiques physiques et des contacts avec l'environnement. Les paramètres des contrôleurs sont échantillonnés par entropie croisée dans le simulateur, puis transférés directement au robot réel, les contrôleurs simulés et physiques étant identiques. Les démonstrations portent sur des tâches de manipulation où le robot exploite la géométrie de l'environnement pour déplacer des objets, avec code et vidéos disponibles sur le site du premier auteur, Andreu Matoses. L'écart entre planification symbolique et exécution physique reste l'un des obstacles majeurs de la robotique de manipulation : les algorithmes TAMP classiques comme PDDLStream ou STRIPStream produisent des plans logiquement valides mais physiquement irréalisables, car ils ignorent frottements, dynamiques d'actionneurs et contacts réels. En rendant le simulateur physique central à l'optimisation, cette approche contourne les abstractions géométriques simplificatrices qui créent cet écart. L'identité entre contrôleurs simulés et réels réduit mécaniquement le sim-to-real gap, facteur d'échec récurrent lors du déploiement de politiques apprises en simulation vers des robots physiques. La planification TAMP est portée depuis plus de vingt ans par des travaux fondateurs comme ceux de Kaelbling et Lozano-Pérez au MIT CSAIL. La tendance récente privilégie l'intégration de modèles de fondation visuels (VLA), dont pi-zero de Physical Intelligence ou GR00T N2 de NVIDIA, pour opérer dans des environnements ouverts et non structurés. L'approche par entropie croisée et simulation physique constitue une alternative plus classique et interprétable, proche des méthodes MPPI ou MuJoCo MPC. Ce travail reste une démonstration académique sur des tâches de manipulation contrôlées : aucun déploiement industriel ni partenariat commercial n'est annoncé.

RecherchePaper
1 source
PRIME : estimation inertielle et de mouvement physiquement cohérente pour robots à pattes et humanoïdes
3arXiv cs.RO 

PRIME : estimation inertielle et de mouvement physiquement cohérente pour robots à pattes et humanoïdes

Une équipe de chercheurs a présenté PRIME (Physically-consistent Robotic Inertial and Motion Estimation), une méthode d'estimation de mouvement pour robots à pattes et humanoïdes publiée sur arXiv en mai 2026 (arXiv:2605.17681). Là où les pipelines conventionnels basés sur des filtres de Kalman étendus (EKF) ou la capture de mouvement externe ne reconstruisent que la cinématique, PRIME formule le problème comme une estimation MAP (Maximum A Posteriori) qui raffine simultanément les données proprioceptives brutes et les commandes des actionneurs pour produire une trajectoire dynamiquement cohérente. L'algorithme estime conjointement les forces de contact frictionnelles et les paramètres inertiels du robot (masses, centres de masse, moments d'inertie), via une modélisation différentiable de la dynamique de contact avec contraintes de complémentarité lissées et un modèle de friction d'Anitescu. Les validations ont été conduites sur des robots quadrupèdes et sur l'humanoïde Unitree G1, lors de séquences de locomotion à contacts multiples en déploiement réel. Le problème abordé est structurel : les pipelines de perception robotique actuels ignorent les forces de contact et les paramètres inertiels effectifs du système, ce qui entraîne des reconstructions qui violent régulièrement la dynamique des corps rigides, en particulier lors des phases de contact. Cette incohérence dégrade la qualité des données d'entraînement et limite la robustesse des contrôleurs en boucle fermée. PRIME produit des reconstructions de mouvement annotées en forces et contacts directement depuis des robots en déploiement terrain, sans infrastructure de laboratoire. Pour les équipes qui développent des modèles de fondation robotiques ou des architectures Visual-Language-Action (VLA), cette capacité représente une source de données haute qualité exploitable à grande échelle, là où la rareté d'annotations dynamiques fiables reste un goulot d'étranglement reconnu. L'estimation d'état pour robots à pattes est un problème ancien, historiquement traité par EKF couplés à la proprioception, la capture de mouvement restant cantonnée aux laboratoires. PRIME se distingue en proposant une solution embarquée et déployable en conditions réelles, sans dépendance à une infrastructure externe. L'humanoïde Unitree G1, commercialisé autour de 16 000 dollars et très présent dans la recherche académique mondiale, sert de banc de validation représentatif. Dans un contexte où Boston Dynamics, Figure AI, Agility Robotics, 1X et Unitree accumulent des données de déploiement pour alimenter leurs pipelines d'apprentissage, PRIME propose une brique méthodologique transversale pour enrichir ces corpus avec des annotations dynamiques fiables. Les applications naturelles incluent l'imitation learning, le transfert sim-to-real et l'entraînement de modèles de fondation à partir de données terrain.

UELes équipes de recherche européennes en locomotion robotique (INRIA, LAAS-CNRS) pourraient exploiter PRIME pour enrichir leurs pipelines d'entraînement sans infrastructure de laboratoire, mais aucun acteur ou institution européen n'est directement impliqué.

RecherchePaper
1 source
RobotAPO : optimisation adversariale des préférences physiques pour la génération de vidéos de manipulation robotique
4arXiv cs.RO 

RobotAPO : optimisation adversariale des préférences physiques pour la génération de vidéos de manipulation robotique

Des chercheurs proposent RobotAPO, un cadre d'optimisation par préférences physiques adversariales destiné aux modèles de génération vidéo de manipulation robotique, accompagné d'un jeu de données baptisé AgiBot-PhysPref (preprint arXiv 2610.09454, première version). Ce jeu compte 10 000 échantillons de préférences soigneusement sélectionnés. Il isole des violations physiques à conditions égales, comme l'interpénétration d'objets ou le mouvement prématuré d'un objet à la frontière d'interaction. RobotAPO opère directement dans l'espace de débruitage continu du flow-matching. Un « proposeur contrefactuel » adversarial léger apprend, pour chaque condition, une direction de l'espace de débruitage biaisée vers l'échec physique. Le modèle est ainsi poussé à explorer cette frontière et à la respecter, au lieu de mémoriser des échecs statiques. À l'inférence, l'interface reste un simple couple prompt et image de référence, sans conditionnement structurel externe. Sur des conditions AgiBot mises de côté pour le test, RobotAPO dépasse la meilleure base de comparaison interne contrôlée de 6,8 % en score de cohérence physique « dur » et de 10,0 % en score « souple ». En rejeu sur robot réel, le taux de réussite des tâches progresse de 37,4 % en relatif face à cette même référence. Ces résultats visent un point faible des vidéos utilisées comme plans visuels pour des agents incarnés. Une vidéo qui paraît plausible peut contenir une erreur de contact de quelques images, et cette erreur fausse le timing et la pose que l'on déduit ensuite pour l'exécution. Le fine-tuning supervisé classique n'exerce aucune pression directe sur ces défauts localisés. Les auteurs montrent qu'une correction ciblée de la physique d'interaction se traduit en gain mesurable sur matériel, ce qui est l'argument le plus utile pour les équipes qui misent sur des modèles du monde génératifs comme couche de planification. Il faut toutefois lire les chiffres avec prudence. La référence est interne, et le gain de 37,4 % est relatif : sans le taux de réussite absolu, le nombre d'essais et la diversité des tâches, on ne peut pas juger de sa portée pratique. Le « rejeu » sur robot réel d'une vidéo générée ne dit rien non plus de la robustesse hors distribution. Ce n'est pas un produit, mais un résultat de recherche. Le travail s'inscrit dans la montée des approches « vidéo comme politique » ou « vidéo comme plan », où un générateur produit la trajectoire visuelle et un module d'inversion la convertit en actions. L'alignement par préférences, déjà courant pour les LLM et la génération d'images, est ici transposé à la physique du contact. Le choix d'AgiBot comme base de données montre que les grands corpus de manipulation issus des acteurs chinois servent désormais de terrain d'évaluation central. Ces travaux concurrencent des pistes voisines, comme les modèles de monde conditionnés par la structure, ou les politiques VLA directes de type Pi-0 et GR00T, qui évitent l'étape vidéo. Les auteurs ne mentionnent ni code ni modèle publiés dans ce résumé. La suite logique serait une validation sur d'autres plateformes et sur des tâches plus longues, avec des taux de réussite absolus publiés.

RecherchePaper
1 source