Aller au contenu principal
Vers un contrôle adaptatif des robots humanoïdes par distillation multi-comportements et affinage renforcé
RecherchearXiv cs.RO 

Vers un contrôle adaptatif des robots humanoïdes par distillation multi-comportements et affinage renforcé

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs propose Adaptive Humanoid Control (AHC), un framework de contrôle locomoteur pour humanoïdes publié sur arXiv (2511.06371v3). Le problème de départ est structurel : les méthodes dominantes entraînent une politique séparée pour chaque compétence (se relever, marcher, courir, sauter), générant des contrôleurs rigides qui échouent dès que le terrain devient irrégulier. AHC y répond en deux phases : d'abord, plusieurs politiques primaires sont entraînées puis fusionnées par distillation multi-comportements en un contrôleur unique capable de commuter dynamiquement selon le contexte ; ensuite, un affinage par renforcement avec retours en ligne consolide l'adaptabilité sur terrains variés. Le système est validé en simulation et en conditions réelles sur le robot Unitree G1 d'Unitree Robotics.

Pour les intégrateurs et les décideurs industriels, la promesse est concrète : un seul contrôleur couvrant l'ensemble des comportements locomoteurs réduit la complexité opérationnelle et supprime les transitions manuelles entre modes. Du côté de la recherche, le résultat le plus notable est que la distillation combinée à un fine-tuning par RL en ligne permet de réduire partiellement le sim-to-real gap sans ré-entraînement complet. La réserve à formuler : le papier ne publie pas de métriques quantitatives détaillées (taux de succès par terrain, fréquence de chute), ce qui rend difficile la comparaison objective avec d'autres approches.

Le Unitree G1 (1,27 m, environ 35 kg, 16 000 dollars) est devenu depuis 2024 une plateforme de recherche de référence pour ce type de travaux. AHC s'inscrit dans une compétition internationale où Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure (Helix) et Boston Dynamics cherchent tous à produire des politiques locomotrices généralisables hors environnement contrôlé. L'approche par distillation multi-politiques rappelle les travaux de curriculum learning menés à Berkeley et CMU, et l'affinage par RL en ligne emprunte aux méthodologies RLHF adaptées à la robotique physique. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé ; le projet en est au stade de la démonstration académique.

À lire aussi

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes
1arXiv cs.RO 

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes

Une équipe de recherche a publié le 2 septembre 2026 sur arXiv (2609.01518) un système d'architecture comportementale pour la loco-manipulation sur robots humanoïdes, conçu pour tourner localement et être modifié en temps réel pendant l'exécution. L'architecture combine des Affordance Templates centrées objets, une structure en arbre organisant la logique des tâches, et une scène de perception éditable au runtime, exécutée par un contrôleur corps entier combinant marche et mouvements du buste, avec une interface opérateur synchronisée en continu pour superviser et corriger à la volée. Testé sur un Unitree H1-2 et un second robot nommé Alex sur six variantes de tâches, le système franchit une porte à pousser en 34 secondes et trie six balles par couleur en 45 secondes sous perturbation humaine directe. Des sessions d'autorat chronométrées montrent la création ou l'adaptation d'un comportement de loco-manipulation en quelques heures. Ce résultat nuance un discours dominant dans la robotique humanoïde, où la performance repose de plus en plus sur des modèles vision-langage-action entraînés de bout en bout, à la manière de Pi-0, GR00T N2 ou Helix. Les auteurs affirment que leur approche, explicitement programmée plutôt qu'apprise, reste compétitive face à ces systèmes récents, tout en offrant un avantage opérationnel : créer ou corriger un comportement en heures plutôt qu'en semaines de collecte de données. Pour les intégrateurs et décideurs industriels, cela ouvre une voie alternative moins dépendante de gigantesques jeux de démonstrations, potentiellement plus rapide à auditer sur site, même si les chiffres de cycle avancés restent issus de démonstrations contrôlées. Le travail s'inscrit dans la course à l'autonomie des humanoïdes pour des tâches physiquement pénibles, dangereuses ou répétitives, un terrain disputé par Figure AI avec Figure 03, Tesla avec Optimus Gen 3 ou NVIDIA avec GR00T, majoritairement pariés sur l'apprentissage à grande échelle. En misant sur une architecture éditable localement et supervisée par un opérateur, les auteurs positionnent leur système comme complémentaire, voire alternatif, à ces approches pilotées par les données. Aucun acteur français ou européen n'est cité, et cette publication reste à ce stade une contribution de recherche sur arXiv plutôt qu'un produit commercialisé, sans calendrier annoncé de pilotes au-delà des six tâches démontrées.

RecherchePaper
1 source
CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes
2arXiv cs.RO 

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes

Une équipe de recherche présente CMoE (Contrastive Mixture of Experts), un framework d'apprentissage par renforcement en une seule étape pour la locomotion de robots humanoïdes sur terrains complexes. L'article, référencé arXiv:2603.03067v2 et publié en version révisée, part d'un constat technique : dans une architecture classique de mixture of experts (MoE), le réseau de gating censé activer sélectivement des experts selon le terrain finit en pratique par répartir presque uniformément l'activation entre eux, annulant l'intérêt de la spécialisation. CMoE corrige ce défaut par une contrainte d'apprentissage contrastif qui rend les activations d'experts cohérentes sur un même type de terrain tout en les différenciant d'un terrain à l'autre. Testée sur le robot humanoïde Unitree G1, la méthode permet de franchir des marches continues jusqu'à 20 cm de haut et des espaces jusqu'à 80 cm de large, avec une démarche jugée robuste et naturelle sur des terrains mixtes, des résultats présentés comme supérieurs aux méthodes existantes. Le code est publié en accès libre. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : la généralisation de la locomotion sur terrain non structuré, condition nécessaire à tout déploiement hors laboratoire. L'architecture MoE gagne du terrain pour doter un même modèle de comportements moteurs spécialisés, mais l'étude montre que sa spécialisation théorique ne se matérialise pas sans mécanisme correctif dédié, un avertissement pour les équipes qui empilent des experts sans vérifier leur activation réelle. Les chiffres de franchissement donnent un repère concret pour comparer les capacités locomotrices annoncées par différents laboratoires, mais restent des résultats obtenus en conditions expérimentales contrôlées sur une seule plateforme, sans validation en déploiement réel. CMoE s'inscrit dans la lignée des travaux adaptant les architectures mixture of experts, popularisées par les grands modèles de langage, au contrôle moteur des robots à pattes et humanoïdes, un domaine où plusieurs équipes cherchent à dépasser les limites des politiques de marche uniques entraînées par renforcement. Le choix du Unitree G1 confirme le rôle de ce robot chinois disponible dans le commerce comme banc d'essai de référence pour la recherche académique en locomotion humanoïde. En publiant leur code, les auteurs visent à permettre à la communauté de reproduire et d'étendre leurs résultats, sans annoncer de partenariat industriel, de pilote commercial ni de calendrier de transfert vers un produit, ce qui situe ce travail au stade de la recherche plutôt que du déploiement.

RecherchePaper
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
3arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source
ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs
4arXiv cs.RO 

ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs

Un preprint publié sur arXiv (2609.09918) décrit ViBe (Visual Behavior Adaptation), un framework de post-entraînement qui ajoute une perception visuelle aux contrôleurs de suivi de mouvement pour humanoïdes à corps complet. La méthode réutilise des encodeurs visuels pré-entraînés via un module extracteur multi-requêtes, injecte ce retour perceptif dans le tracker par des adaptateurs low-rank (LoRA) pour un réglage économe en paramètres, puis ajuste l'ensemble par optimisation de politique à partir d'un reward de tâche et d'un jeu de données de référence. Sur quatre tâches, la marche perceptive sur trottoirs et parcours type parkour, le repositionnement d'un cube (Repose Cube), la locomotion-manipulation d'objets variés et l'esquive de balles (dodgeball), le transfert sim-to-real s'effectue en zero-shot et reste robuste en extérieur, en faible luminosité et face à des distracteurs visuels RGB, y compris pour une variante orientée objectif de Repose Cube résolue avec un planificateur volontairement simple. L'apport ne se limite pas à la démonstration technique. Les trackers de mouvement actuels, entraînés en simulation par imitation de trajectoires, n'intègrent aucune perception extéroceptive et dépendent donc d'un planificateur de haut niveau pour réagir à l'environnement. Les contrôleurs perceptifs existants comblaient ce manque en entraînant des encodeurs purement géométriques depuis zéro, plus faciles à transférer en réel mais pauvres en sémantique, et en passant par une distillation élève-enseignant propre à chaque tâche, coûteuse à répéter. En réutilisant des encodeurs visuels pré-entraînés et en cantonnant l'adaptation à des modules low-rank, ViBe suggère que le goulot d'étranglement du contrôle humanoïde perceptif se déplace de la simulation physique, déjà largement maîtrisée, vers l'intégration efficace de la perception sémantique, un point clé pour les intégrateurs qui cherchent à sortir ces robots des environnements contrôlés d'usine. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement à grande échelle pour la locomotion humanoïde, où le transfert sim-to-real reste le paradigme dominant, et se distingue des architectures vision-langage-action de bout en bout comme Pi-0 ou GR00T N2 en proposant une adaptation légère d'un tracker déjà entraîné plutôt qu'une politique généraliste entraînée sur un large corpus de démonstrations. Publié comme contribution académique, sans partenariat industriel ni plateforme commerciale nommée à ce stade, l'article n'évoque aucun déploiement réel. La suite logique consisterait à valider la méthode sur des humanoïdes commerciaux et à la comparer directement, en coût d'entraînement et en robustesse, aux pipelines de distillation élève-enseignant aujourd'hui utilisés par les acteurs du secteur.

RecherchePaper
1 source