Aller au contenu principal
RecherchearXiv cs.RO 

CHOREO : chaque compétence humanoïde représentée comme une trajectoire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CHOREO est un framework de recherche qui permet de composer des compétences hétérogènes de robots humanoïdes sans réentraînement, testé sur le robot Unitree G1 dans le simulateur physique MuJoCo. L'idée centrale : quelle que soit sa méthode d'apprentissage (renforcement, imitation de mouvement, modèles génératifs), une compétence peut toujours s'exprimer comme une trajectoire exécutable, convertie en une représentation unifiée baptisée SkillMotion, qui combine états de mouvement, contacts, sémantique et conditions aux limites. Les compétences s'enchaînent ensuite par continuation directe, lissage cubique de Hermite ou mouvements de transition validés, sans réentraîner les modèles source ni les mettre à jour au moment du test. Sur 2 950 assets SkillMotion issus de sources hétérogènes, le système atteint 95,4% de réussite sur 130 tâches multi-actions, dont 93,8% sur des séquences de huit actions.

Le problème visé est structurel : les compétences humanoïdes sont aujourd'hui produites par des méthodes incompatibles, chacune avec ses représentations, interfaces et contrôleurs, ce qui oblige intégrateurs et équipes R&D à reconstruire des politiques monolithiques à chaque nouvelle capacité, une contrainte coûteuse face à des modèles généralistes comme Pi-0 (Physical Intelligence), GR00T N2 (Nvidia) ou Helix (Figure). En montrant qu'une trajectoire exécutable peut servir d'interface commune indépendamment de la méthode d'apprentissage, CHOREO esquisse une voie vers des bibliothèques de comportements cumulables sans coût de réentraînement, un enjeu central pour l'industrialisation des humanoïdes polyvalents. Ces résultats restent toutefois obtenus entièrement en simulation, sur un seul robot, sans validation matérielle mentionnée, laissant ouverte la question du transfert réel.

Ce travail s'inscrit dans la multiplication des approches d'apprentissage de compétences pour humanoïdes : renforcement pour la locomotion et la manipulation, imitation à partir de capture de mouvement, et modèles vision-langage-action popularisés par Physical Intelligence, Nvidia ou Figure, chacun produisant des politiques aux espaces d'action et contrôleurs incompatibles entre eux. Le choix du Unitree G1, plateforme très utilisée en recherche académique pour son coût et sa disponibilité, signale un positionnement scientifique plutôt que produit, aucune entreprise partenaire n'étant citée. Publié en preprint sur arXiv, le papier n'annonce pas de calendrier précis, mais les suites logiques seraient l'extension de la bibliothèque de compétences et une validation sur robot physique pour confirmer la tenue hors simulateur.

À lire aussi

RPG : commutation robuste de politiques pour des transitions fluides entre compétences en combat humanoïde
1arXiv cs.RO 

RPG : commutation robuste de politiques pour des transitions fluides entre compétences en combat humanoïde

Une équipe de chercheurs a publié le 21 avril 2026 sur arXiv (2604.21355) un framework baptisé RPG (Robust Policy Gating), conçu pour permettre à des robots humanoïdes d'enchaîner plusieurs compétences de combat dynamique sans instabilité. L'approche repose sur une politique unifiée entraînée avec deux mécanismes de randomisation : la randomisation des transitions de mouvement, qui expose la politique à des états initiaux et terminaux variés entre compétences, et la randomisation temporelle, qui rend l'agent robuste aux coupures imprévises dans la séquence de mouvements. La pipeline de contrôle intègre la locomotion (marche, course) avec les compétences de combat, permettant théoriquement des séquences de durée arbitraire. Le système a été validé en simulation extensive, puis déployé sur le robot humanoïde Unitree G1, la plateforme à 23 DDL du constructeur chinois Unitree Robotics. Le problème central que RPG adresse est connu dans le domaine sous le nom de "skill transition gap" : lorsqu'un agent bascule d'une politique spécialisée à une autre, les états terminaux de la première ne correspondent pas aux états initiaux supposés de la seconde, produisant des comportements hors domaine, des chutes ou des mouvements saccadés. Les approches concurrentes utilisent soit une commutation entre politiques mono-compétence, soit une politique généraliste qui imite des motion clips de référence -- les deux souffrent de ce décalage. RPG propose une solution d'entraînement plutôt que d'architecture, ce qui est notable : la robustesse aux transitions est injectée pendant la phase d'apprentissage, pas via un mécanisme de gating à l'inférence. L'absence de métriques quantitatives dans la publication (temps de cycle, taux de chute, nombre de transitions testées) limite cependant la comparaison directe avec d'autres travaux. RPG s'inscrit dans une vague active de recherche sur le contrôle corps entier des humanoïdes pour des tâches hautement dynamiques, un domaine où les laboratoires UCB, CMU et Stanford publient régulièrement depuis 2023. L'utilisation du G1 comme plateforme de validation est cohérente avec sa popularité croissante en recherche académique, notamment grâce à son coût inférieur à celui des plateformes concurrentes (Boston Dynamics Atlas, Agility Digit). Sur le plan commercial, des acteurs comme Figure AI, 1X Technologies ou Apptronik ciblent des tâches répétitives en entrepôt plutôt que le combat, mais les techniques de transition de compétences développées ici sont directement transposables aux scénarios industriels nécessitant des enchaînements fluides de manipulation et de locomotion. La prochaine étape naturelle serait une évaluation quantitative en conditions adversariales réelles, ainsi qu'un transfert vers des tâches moins "spectaculaires" mais plus proches du déploiement B2B.

RecherchePaper
1 source
Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes
2arXiv cs.RO 

Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes

Des chercheurs ont publié le 25 juin 2026 sur arXiv (preprint 2606.25706) un cadre de contrôle baptisé "asynchronous upper body task-space tracking" pour robots humanoïdes. Le problème qu'ils adressent est architectural : les planificateurs de haut niveau génèrent des trajectoires dans l'espace des tâches à faible fréquence (quelques Hz), alors que les contrôleurs de corps entier tournent à haute fréquence (typiquement plusieurs centaines de Hz). Cette désynchronisation temporelle entre planification et exécution produit des dérives de référentiel et des incohérences dans le contrôle. Pour y remédier, l'équipe propose une politique étudiante initialisée par distillation enseignant-étudiant, conditionnée sur la trajectoire future complète mise en cache et un index d'exécution temporel, puis entraînée avec une récompense globale à fenêtre glissante. Un module MPC (Model Predictive Control) complète les références creuses en guidage corps flottant et membre supérieur, tandis que des contraintes au niveau des actions et de la cinématique directe (FK) limitent la dérive de la politique. Les expériences ont été conduites en simulation et sur le robot Unitree G1, un humanoïde commercial à 23 degrés de liberté. Ce travail touche un goulot d'étranglement concret qui freine la commercialisation des humanoïdes : la chaîne planification-exécution reste fragmentée dans la quasi-totalité des architectures actuelles, forçant des compromis entre réactivité et cohérence de mouvement. Le fait que la politique obtienne de meilleures performances que les baselines synchrones et découplées, et qu'elle s'adapte plus sûrement aux mouvements hors distribution, suggère une progression vers un déploiement robuste en environnement non contrôlé. L'approche sans estimation explicite de référentiel réduit aussi la charge computationnelle, ce qui est pertinent pour les intégrateurs industriels cherchant à embarquer le traitement. Toutefois, il s'agit d'un preprint non encore évalué par les pairs, et les métriques de suivi de trajectoire présentées restent contextualisées à des scénarios de laboratoire ; la généralisabilité à des tâches industrielles réelles reste à démontrer. Unitree Robotics, fabricant chinois fondé en 2016, s'est imposé comme fournisseur de plateformes de recherche abordables avec des robots quadrupèdes puis le G1 humanoïde. Ce contexte explique le choix du matériel : le G1 est accessible à de nombreux labos académiques, ce qui élargit la portée reproductible des résultats. Sur le fond, la course à la maîtrise du pipeline planification-exécution pour les humanoïdes mobilise simultanément Figure (02 et bientôt 03), Tesla Optimus, Agility Robotics, 1X Technologies et les laboratoires académiques liés à Physical Intelligence (Pi-0) et à NVIDIA (GR00T N2). La distillation enseignant-étudiant couplée au MPC comme module de complétion de trajectoire s'inscrit dans une tendance plus large : combler le sim-to-real gap par des architectures hybrides apprises/optimisées plutôt que par du RL pur. Les prochaines étapes naturelles seraient une validation sur des cycles de manipulation répétitifs en cadence industrielle et une intégration avec des VLA (Vision-Language-Action models) pour fermer la boucle perception-planification-exécution.

RecherchePaper
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
3arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source
Apprentissage par renforcement à entropie de trajectoire pour un apprentissage robuste des compétences motrices des robots
4arXiv cs.RO 

Apprentissage par renforcement à entropie de trajectoire pour un apprentissage robuste des compétences motrices des robots

Des chercheurs publient une nouvelle méthode d'apprentissage par renforcement pour le contrôle robotique, baptisée Trajectory Entropy Reinforcement Learning, décrite dans un article déposé sur arXiv (référence 2505.04193, version 2). Le principe consiste à minimiser l'entropie de la trajectoire complète des actions produites par l'agent, c'est-à-dire le nombre de bits nécessaires pour décrire ces actions une fois les états observés, au lieu de s'appuyer uniquement sur la maximisation de récompense classique. Cette entropie est estimée via un modèle de prédiction d'actions à paramétrage variationnel, utilisé pour construire une fonction de récompense régularisée par l'information ; un algorithme permet ensuite d'optimiser conjointement la politique et ce modèle de prédiction. Testée sur plusieurs tâches de locomotion à haute dimension, la méthode produit des trajectoires d'actions plus cycliques et cohérentes, avec de meilleures performances et une robustesse supérieure au bruit et aux changements dynamiques que les approches de référence. Le résultat cible un point faible connu du RL profond appliqué au contrôle : les politiques neuronales capturent souvent des corrélations complexes et fallacieuses entre observations et actions, ce qui les rend fragiles dès qu'une perturbation légère affecte l'environnement, un frein direct au transfert simulation-vers-réel. En imposant un biais de simplicité mesuré par une quantité d'information plutôt qu'une régularisation ad hoc, ce travail propose un levier générique de robustesse, potentiellement transposable au-delà de la locomotion vers la manipulation ou les tâches de robots mobiles autonomes en environnement non contrôlé, un enjeu central pour tout intégrateur cherchant à sortir de la démonstration en labo. Cette contribution s'inscrit dans une lignée de recherches sur les biais inductifs de simplicité en apprentissage par renforcement, une direction distincte des approches dominantes misant sur l'échelle des données, à l'image des politiques vision-langage-action généralistes type Pi-0 ou GR00T N2. Publié sous forme de révision croisée entre catégories arXiv, l'article reste une contribution académique validée en simulation, sans mention de déploiement matériel, de partenariat industriel ni de calendrier de transfert vers une pile robotique commerciale.

RecherchePaper
1 source