Aller au contenu principal
Échantillonner, simuler, sélectionner : le pilotage par la physique pour le texte-vers-mouvement des humanoïdes sans entraînement
RecherchearXiv cs.RO 

Échantillonner, simuler, sélectionner : le pilotage par la physique pour le texte-vers-mouvement des humanoïdes sans entraînement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente S³ (Sample-Simulate-Select), une méthode permettant à un humanoïde d'exécuter des commandes textuelles sans aucun entraînement supplémentaire, en plaçant directement le contrôleur de déploiement dans la boucle de génération. Pour chaque instruction, S³ tire N mouvements candidats d'un modèle text-to-motion figé, les retargete vers un robot Unitree G1 par cinématique inverse à correspondance de direction, les simule sous dynamique rigide complète avec la politique de suivi préentraînée SONIC, puis conserve le candidat le mieux exécuté. Sur 200 prompts stratifiés issus de HumanML3D, avec huit candidats par instruction, le taux d'exécution en position debout passe de 83,5% à 89,5%, et les passages du filtre matériel bondissent de 33 à 85 sur 200 ; sur l'intégralité du split de test (4184 prompts), le taux grimpe de 80,5% à 89,5%. Un vérificateur cinématique, prédisant les chutes avec une AUROC de 0,90, ne récupère qu'un quart de ce gain. Une comparaison avec un second retargeteur, GMR, révèle des échecs complémentaires qui portent le plafond combiné à 95%, et les 177 clips sélectionnés puis exécutés sur un G1 réel se terminent tous debout, avec une erreur de suivi proche de la simulation (r=0,94).

L'intérêt tient à ce que ces gains s'obtiennent sans réentraîner ni le générateur ni le contrôleur, alors que les systèmes récents reliant langage et humanoïdes comblent généralement cet écart par un entraînement dédié. Pour les équipes de recherche appliquée et les intégrateurs, cela suggère qu'un simple filtrage physique par simulation, réutilisant des briques déjà déployées, peut constituer une étape low-cost avant d'investir dans du réentraînement. Le travail tempère toutefois l'enthousiasme : le taux de passage du filtre matériel plafonne à 42,5%, et une classe entière de mouvements, ceux qui abaissent le bassin, échappe totalement à la sélection car aucun candidat généré ne l'exécute correctement.

La méthode s'appuie sur des générateurs text-to-motion entraînés sur HumanML3D et sur la politique de suivi corps-entier SONIC, ici testée sur un Unitree G1, et se positionne explicitement contre l'approche dominante d'un entraînement de bout en bout langage-vers-humanoïde. Il s'agit d'une contribution de recherche, validée à grande échelle en simulation mais sur un nombre restreint de séquences réelles et un seul robot, sans annonce de déploiement commercial ; les auteurs pointent eux-mêmes la limite à lever, les mouvements abaissant le centre de masse, qui exigeront probablement un générateur réentraîné sur des trajectoires robot plutôt qu'une sélection parmi des candidats humains retargetés.

Dans nos dossiers

À lire aussi

GenTrack : alignement physique pour la génération de mouvement natif au robot et le suivi humanoïde en zéro-shot
1arXiv cs.RO 

GenTrack : alignement physique pour la génération de mouvement natif au robot et le suivi humanoïde en zéro-shot

Des chercheurs présentent GenTrack, un nouveau framework d'apprentissage conjoint pour générer et suivre des mouvements sur robots humanoïdes, détaillé dans un article publié le 1er août 2026 sur arXiv (2608.01410v1). Le système a été testé sur le robot Unitree G1, avec deux architectures de suivi de mouvement, ProtoMotions et SONIC. L'évaluation couvre trois jeux de données en zero-shot : les benchmarks publics AMASS et LAFAN, ainsi qu'un ensemble privé de 1 024 paires prompt-mouvement collectées hors distribution, censé refléter des conditions réelles variées. Le principe central de GenTrack consiste à faire alterner deux étapes en ligne : un alignement du générateur de mouvements ancré dans l'exécution réelle et calculé de façon relative par groupe, puis un entraînement du tracker sur les nouvelles références ainsi produites, le tout stabilisé par des mécanismes d'ancrage et de rejeu pour limiter la dérive du modèle. L'enjeu technique visé est connu des équipes qui travaillent sur le contrôle des humanoïdes : les générateurs de mouvement texte-vers-mouvement, entraînés sur des données de capture humaine ou retargetées, produisent des trajectoires plausibles cinématiquement mais souvent inexécutables physiquement par un robot réel. Les approches existantes traitent ce problème dans un seul sens, en figeant soit le corpus généré, soit le tracker récompensé. GenTrack propose une boucle fermée entre les deux composants. Selon les auteurs, cette co-évolution en ligne améliore à la fois l'exécutabilité robotique des mouvements générés et la couverture zero-shot du tracker, avec un gain particulièrement marqué sur les références hors distribution, c'est-à-dire les cas les plus proches d'un usage industriel réel plutôt que d'un benchmark contrôlé. Le travail s'inscrit dans la lignée des recherches sur les modèles de suivi de mouvement génériques pour humanoïdes, où l'extension de la couverture zero-shot dépendait jusqu'ici de corpus embarqués coûteux à agrandir. GenTrack propose une alternative sans collecte de données supplémentaire, en exploitant plutôt un post-entraînement conjoint génération-suivi. L'article ne mentionne pas de déploiement industriel ni de partenaire matériel au-delà du G1 de Unitree utilisé comme plateforme d'évaluation ; il s'agit à ce stade d'une contribution méthodologique plutôt que d'un produit commercialisé.

RecherchePaper
1 source
Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes
2arXiv cs.RO 

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes

Publié sur arXiv (référence 2608.03234v1), le framework Context-Aware Motion Priors (CMP) s'attaque à un défaut connu de l'apprentissage par imitation de mouvements chez les humanoïdes : les motion priors classiques, appris une fois sur tout le jeu de données de référence, sont appliqués uniformément durant l'entraînement sans distinguer les mouvements pertinents pour la tâche en cours. CMP apprend une compatibilité contexte-mouvement à partir des trajectoires de politique les plus prometteuses, tout en restant ancré sur les démonstrations de référence. Les scores obtenus repondèrent la supervision pour entraîner un adaptateur léger conditionné par le contexte, sans étiquetage manuel ni étape de découverte de compétences séparée. L'approche est validée avec deux familles de priors, Adversarial Motion Priors et Score-Matching Motion Priors, sur cinq tâches de contrôle humanoïde. L'enjeu dépasse la performance académique. L'imitation de mouvements par renforcement est la méthode dominante pour doter les humanoïdes de comportements fluides, une brique reprise dans la plupart des piles logicielles du secteur, de Figure à Unitree. Son talon d'Achille reste le caractère générique du prior, incapable de distinguer un mouvement utile d'un mouvement parasite selon la tâche, ce qui pèse sur l'efficacité d'échantillonnage, un facteur critique quand chaque itération d'entraînement coûte du temps de calcul en simulation. En démontrant un gain constant de performance sur cinq tâches sans labellisation additionnelle, CMP s'attaque à un goulot d'étranglement identifié de la recherche en contrôle humanoïde, sans pour autant constituer un système déployé sur robot physique ni un produit annoncé par un fabricant. Le travail s'inscrit dans la lignée des Adversarial Motion Priors, popularisées à partir de 2021 pour l'animation de personnages physiques puis largement reprises dans le contrôle humanoïde par renforcement, et des Score-Matching Motion Priors plus récentes, inspirées des modèles de diffusion. CMP se positionne comme une couche d'adaptation contextuelle au-dessus de ces deux familles plutôt que comme une méthode concurrente. La publication ne précise ni affiliation institutionnelle ni calendrier au-delà de l'article arXiv lui-même ; si les résultats se confirment sur des tâches plus complexes, la suite logique serait une intégration dans les pipelines d'entraînement sim-to-real des acteurs humanoïdes qui s'appuient déjà sur des motion priors pour la locomotion et la manipulation.

RecherchePaper
1 source
Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde
3arXiv cs.RO 

Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde

Un preprint arXiv (2609.18732v1) publié mi-septembre 2026 présente PASSAGE, un système de planification et de suivi de mouvement conditionné par la perception, pour des robots humanoïdes traversant des environnements encombrés en enjambant, contournant ou se baissant devant les obstacles. Entraîné sur 100 heures de mouvements humains captés en réalité virtuelle et par capture inertielle sur 1500 scènes, un planificateur par flow-matching génère des trajectoires courtes exécutées à 50 Hz par un contrôleur corps entier avec retour géométrique, puis affiné par apprentissage par renforcement, contrôleur figé. Passer de 6 à 100 heures de données porte le taux de succès sans contact de 48,1% à 68,9% sur des scènes inédites, jusqu'à 70,3% avec augmentation de scène validée. Le système fonctionne entièrement en embarqué sur un Jetson AGX Orin, avec LiDAR 3D, cartographie en ligne, planification à 6,25 Hz et contrôle à 50 Hz, testé sur 50 configurations physiques inédites sans carte préconstruite ni calcul déporté. Le résultat s'attaque à un verrou du déploiement humanoïde hors laboratoire : choisir et enchaîner, depuis la seule perception embarquée, le bon comportement de franchissement selon la géométrie rencontrée, sans bibliothèque de mouvements ni récompense spécifique à chaque obstacle. Une seule paire planificateur-contrôleur généralise ici à des géométries jamais vues, ce qui va dans le sens d'un passage à l'échelle des données de démonstration plutôt que de l'ingénierie tâche par tâche, comme le montrent déjà les modèles vision-langage-action en manipulation tels que Pi-0, GR00T N2 ou Helix. Ce travail illustre un basculement de la recherche humanoïde, concentrée jusqu'ici sur la manipulation avec les modèles vision-langage-action, vers la locomotion en environnement non structuré, restée en retrait malgré la course menée par Figure, Tesla ou Unitree. Le choix du flow-matching pour générer les trajectoires prolonge une tendance déjà observée après les modèles de diffusion. Le preprint ne précise ni plateforme robotique commerciale ni entreprise porteuse : il reste, à ce stade, un résultat de recherche testé en simulation et sur un nombre limité de configurations physiques réelles, sans calendrier de transfert vers un produit. Aucun acteur français ou européen n'y figure.

RecherchePaper
1 source
PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée
4arXiv cs.RO 

PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée

Un cadre nomme PLAT, pour Privileged LAtent Transition learning, a été publie sur arXiv sous la référence 2609.25754v1. Il s'attaque au contrôle de robots humanoïdes par "keyframes temporisées éparses" : le robot ne reçoit que quelques poses-clés futures et leurs instants d'arrivée souhaites, plutôt qu'une référence dense image par image comme le font les politiques de motion tracking classiques. L'entrainement se déroule en trois étapes : un expert de suivi de mouvement dense preentraine fournit d'abord un prior de mouvement robuste, un prior latent privilégié est ensuite appris par imitation de type DAgger a partir de séquences d'objectifs denses servant de supervision privilégiée, puis un apprentissage par renforcement affine les transitions dans l'espace latent plutôt que les actions elles-mêmes. Les auteurs rapportent un suivi stable et précis en simulation sur des horizons de planification variables, avec un avantage marque a long horizon, et un déploiement réussi sur un robot humanoïde Unitree G1. Le problème vise est concret pour les équipes de recherche et les intégrateurs en robotique humanoïde : les politiques de suivi dense, précises mais rigides, s'exploitent mal comme contrôleurs de haut niveau pour la planification de taches ou la génération interactive de mouvement, car elles exigent une référence complète a chaque instant. En rendant le contrôle pilotable par de simples poses-clés espacées dans le temps, PLAT propose une interface plus légère entre un module de décision, planificateur ou générateur de mouvement, et l'exécution bas niveau, une séparation qui rejoint la logique d'architectures décision/exécution comme GR00T N2 ou Helix. Le transfert réussi vers un robot physique va dans le sens d'un rapprochement simulation-déploiement, même si les résultats quantitatifs reposent surtout sur la simulation, avec un seul modèle de robot teste et aucun taux de réussite en conditions réelles communique dans le résume. Ce travail s'inscrit dans la lignée des politiques de suivi de mouvement entraînées en simulation puis transférées sur robot réel, méthode courante pour les humanoïdes Unitree et dans la recherche en contrôle appris. Il se distingue des modèles généralistes de type VLA, tels Pi-0 ou GR00T N2, en ciblant la couche de contrôle moteur bas niveau plutôt que la perception ou la planification, une brique complémentaire plutôt que rivale. Publie sous la catégorie "new" d'arXiv, sans partenariat industriel ni calendrier de déploiement annonces, PLAT demeure a ce stade une contribution de recherche dont la robustesse hors simulation et sur d'autres plateformes reste a démontrer.

RecherchePaper
1 source