Aller au contenu principal
Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs
RecherchearXiv cs.RO 

Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié fin mai 2026 sur arXiv (arXiv:2605.18611) un framework d'apprentissage par renforcement unifié permettant à un seul contrôleur de faire marcher, courir et se relever après une chute le robot humanoïde Unitree G1, sans commande explicite de changement de mode au déploiement. L'approche étend les Adversarial Motion Priors (AMP) en remplaçant la distribution de référence globale par un mécanisme de routage conditionné à l'état : un seuil fixe sur la gravité projetée (|gz+1| > 0,6, soit environ 37° d'inclinaison du torse par rapport à la verticale) aiguille chaque transition d'entraînement soit vers un discriminateur dédié à la récupération, soit vers un discriminateur de locomotion conditionné par la vitesse commandée, qui couvre à la fois la marche et la course. Seuls trois clips de motion capture extraits du jeu de données LAFAN1 sont nécessaires pour régulariser l'ensemble du comportement. Sur hardware réel, la politique tourne à 50 Hz sous forme d'un fichier ONNX figé, sans aucune logique de mode à l'exécution, et valide des relevés réussis depuis les positions ventrale et dorsale ainsi que des transitions fluides marche-course.

Ce résultat s'attaque directement à un problème d'intégration récurrent dans la robotique humanoïde commerciale : la fragmentation en contrôleurs spécialisés par mode, reliés par des automates à états qui génèrent des zones de transition fragiles et coûteuses à maintenir. Démontrer qu'une politique apprise par RL couvre ces régimes de façon continue sur hardware réel, et non uniquement en simulation, affaiblit l'argument du sim-to-real gap rédhibitoire pour les comportements complexes. Le coût d'annotation est lui aussi remarquablement bas : trois clips de reference suffisent là où d'autres travaux en exigent des dizaines, ce qui rend la méthode potentiellement transférable à d'autres plateformes avec un effort de données limité, qu'il s'agisse du PAL Robotics TALOS, du MIROKAÏ d'Enchanted Tools, ou de tout humanoïde léger à faible budget de motion capture.

La publication s'inscrit dans une course dense à la locomotion humanoïde robuste, où Boston Dynamics (Atlas), Figure (Figure 03), Agility Robotics (Digit) et Tesla (Optimus Gen 3) investissent massivement, mais publient peu. Sur le plan académique, des approches concurrentes comme les VLA (Vision-Language-Action models) de Physical Intelligence ou les travaux de Berkeley visent des politiques encore plus générales, mais sacrifient souvent la robustesse physique au profit de la flexibilité sémantique. L'utilisation du Unitree G1, disponible à environ 16 000 dollars et largement répandu dans les laboratoires, confère à ces travaux une reproductibilité pratique supérieure aux publications sur plateformes fermées. L'article ne précise pas de timeline de déploiement industriel, mais la compatibilité ONNX et l'absence de logique embarquée à l'exécution réduisent la barrière à l'intégration pour un OEM ou un intégrateur souhaitant évaluer la méthode sur sa propre plateforme.

Impact France/UE

La méthode, compatible ONNX et nécessitant seulement 3 clips de motion capture, est explicitement identifiée comme transférable au MIROKAÏ d'Enchanted Tools (FR) et au TALOS de PAL Robotics (EU), réduisant le coût d'adaptation pour les équipes de recherche et les intégrateurs européens.

À lire aussi

Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs
1arXiv cs.RO 

Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs

Des chercheurs ont publié le 21 août 2026 sur arXiv (référence 2608.20087v1) AdaPT, un système de planification et de suivi de mouvement adaptatif qui apprend à des robots humanoïdes à servir et échanger au tennis avec un style proche de celui des joueurs professionnels, directement à partir de vidéos de retransmissions télévisées. L'architecture est hiérarchique : un planificateur génère la trajectoire cinématique stylisée, tandis qu'un module de suivi (tracker) l'exécute en interférant le moins possible avec le plan initial. Validée en simulation, l'approche a ensuite révélé un écart important entre simulation et réel sur le robot Unitree G1, la précision du suivi se dégradant à cause de la planification autorégressive et du bruit de perception ; pour corriger cela, les auteurs ont entraîné le tracker à suivre des vitesses d'exécution randomisées et conditionné le planificateur via un adaptateur de vitesse appris. Les politiques AdaPT ont ensuite été déployées sur le robot humanoïde grand format Dobot Atom (1,7 mètre), capable de servir en conditions réelles sans capture de mouvement, avec vidéos et code publiés sur le site du projet. Ce résultat illustre concrètement la possibilité de transférer un mouvement stylisé et physiquement exigeant, appris depuis de simples vidéos, vers un robot humanoïde grande taille opérant sans motion capture ni environnement contrôlé, un enjeu central pour l'industrie face au fossé habituel entre démonstrations et performance réelle. Il faut toutefois le lire comme un résultat de recherche académique et non comme un produit commercialisé : aucune annonce de volumes, de prix ni de partenariat industriel n'accompagne la publication, et les essais restent limités en nombre. La méthode elle-même dépasse le seul tennis, puisqu'elle traite un problème plus général, générer des mouvements stylistiques complexes sans sacrifier la performance de la tâche, pertinent pour toute application humanoïde exigeant dextérité et fluidité. Ce travail s'inscrit dans une vague récente de recherches sur des humanoïdes jouant à des sports de balle, un domaine où plusieurs laboratoires ont récemment montré des frappes ou services au tennis, badminton ou ping-pong, souvent via des architectures de type VLA ou du renforcement pur. AdaPT se distingue par la combinaison d'une imitation de style issue de vidéos de diffusion et d'une architecture planificateur/tracker pensée spécifiquement pour limiter la dégradation lors du transfert simulation-réel. Les tests ont porté sur deux plateformes, le Unitree G1, standard courant en recherche sur la locomotion, et le Dobot Atom, humanoïde grand format du fabricant chinois Dobot. Les auteurs n'annoncent aucun calendrier de pilote commercial, se limitant à publier code et vidéos et à souligner des enseignements algorithmiques et d'ingénierie pour de futurs systèmes humanoïdes sportifs.

RecherchePaper
1 source
Apprentissage des mouvements de patinage à roulettes pour robots humanoïdes via des priorités de mouvement adverses
2arXiv cs.RO 

Apprentissage des mouvements de patinage à roulettes pour robots humanoïdes via des priorités de mouvement adverses

Des chercheurs présentent, dans un article déposé le 14 juillet 2026 sur arXiv (2607.10815), une méthode d'apprentissage par renforcement pour faire patiner un robot humanoïde en rollers. Le système s'appuie sur les Adversarial Motion Priors (AMP), une technique qui entraîne une politique de contrôle à imiter des mouvements de référence tout en respectant les contraintes physiques du robot. Deux allures distinctes sont visées : le Pump Glide (une godille d'impulsion) et le Push Glide (une poussée alternée classique du patinage). Pour chacune, les auteurs ont capturé des données de mouvement humain par motion capture, puis les ont retargetées, c'est-à-dire adaptées à la morphologie du robot humanoïde, avant de les lisser et de les rééchantillonner en états de référence exploitables pour l'entraînement AMP. Les deux allures sont apprises séparément, avec des jeux de données, des politiques et des architectures de récompense entièrement indépendants. Des expériences en simulation évaluent la qualité du geste, le suivi de vitesse, la capacité à tourner et l'apport de chaque composante de récompense via des ablations. L'enjeu dépasse l'anecdote du robot à roulettes : patiner impose de gérer simultanément l'équilibre corps entier, des contacts roulants à faible frottement et une posture qui varie avec la vitesse, un problème de contrôle nettement plus contraint que la marche ou la course déjà démontrées sur humanoïdes. Réussir ce type de locomotion en simulation valide la robustesse des pipelines AMP pour des dynamiques de contact inhabituelles, un signal utile pour les équipes qui explorent des locomotions non conventionnelles (patins, skis, roues) au-delà des gaits bipèdes standards. Cela reste toutefois un résultat de simulation, sans transfert annoncé vers un robot physique ni précision sur la plateforme matérielle visée. Les méthodes AMP, popularisées dans l'animation de personnages puis reprises en robotique pour générer des démarches naturelles et stables, connaissent depuis deux ans une adoption croissante dans le contrôle d'humanoïdes, portée par des laboratoires travaillant sur la locomotion bipède avancée. Cet article s'inscrit dans cette lignée en repoussant le champ d'application vers des gaits hybrides homme-machine inédits. Les auteurs ne mentionnent pas de calendrier de validation sur robot réel ni de partenaire industriel associé à ces travaux.

RecherchePaper
1 source
CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes
3arXiv cs.RO 

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes

Une équipe de recherche présente CMoE (Contrastive Mixture of Experts), un framework d'apprentissage par renforcement en une seule étape pour la locomotion de robots humanoïdes sur terrains complexes. L'article, référencé arXiv:2603.03067v2 et publié en version révisée, part d'un constat technique : dans une architecture classique de mixture of experts (MoE), le réseau de gating censé activer sélectivement des experts selon le terrain finit en pratique par répartir presque uniformément l'activation entre eux, annulant l'intérêt de la spécialisation. CMoE corrige ce défaut par une contrainte d'apprentissage contrastif qui rend les activations d'experts cohérentes sur un même type de terrain tout en les différenciant d'un terrain à l'autre. Testée sur le robot humanoïde Unitree G1, la méthode permet de franchir des marches continues jusqu'à 20 cm de haut et des espaces jusqu'à 80 cm de large, avec une démarche jugée robuste et naturelle sur des terrains mixtes, des résultats présentés comme supérieurs aux méthodes existantes. Le code est publié en accès libre. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : la généralisation de la locomotion sur terrain non structuré, condition nécessaire à tout déploiement hors laboratoire. L'architecture MoE gagne du terrain pour doter un même modèle de comportements moteurs spécialisés, mais l'étude montre que sa spécialisation théorique ne se matérialise pas sans mécanisme correctif dédié, un avertissement pour les équipes qui empilent des experts sans vérifier leur activation réelle. Les chiffres de franchissement donnent un repère concret pour comparer les capacités locomotrices annoncées par différents laboratoires, mais restent des résultats obtenus en conditions expérimentales contrôlées sur une seule plateforme, sans validation en déploiement réel. CMoE s'inscrit dans la lignée des travaux adaptant les architectures mixture of experts, popularisées par les grands modèles de langage, au contrôle moteur des robots à pattes et humanoïdes, un domaine où plusieurs équipes cherchent à dépasser les limites des politiques de marche uniques entraînées par renforcement. Le choix du Unitree G1 confirme le rôle de ce robot chinois disponible dans le commerce comme banc d'essai de référence pour la recherche académique en locomotion humanoïde. En publiant leur code, les auteurs visent à permettre à la communauté de reproduire et d'étendre leurs résultats, sans annoncer de partenariat industriel, de pilote commercial ni de calendrier de transfert vers un produit, ce qui situe ce travail au stade de la recherche plutôt que du déploiement.

RecherchePaper
1 source
Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture
4arXiv cs.RO 

Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture

Un article publié sur arXiv (référence 2609.20558v1) présente un cadre logiciel permettant à un robot humanoïde Unitree G1 d'exécuter des tâches de couvreur sur toitures en pente : marche en montée, utilisation d'une cloueuse pneumatique, martelage et mouvements de flexion. La méthode capture des démonstrations humaines par un système de suivi de mouvement, les retranscrit sur le robot, puis s'appuie sur un modèle métrique 3D du toit pour ancrer précisément les points de contact des pieds et des mains ainsi que les relations de travail (distance à l'outil, zones de dégagement) à la surface réelle. Une optimisation au niveau de la trajectoire fixe ces contraintes, tandis qu'un apprentissage par renforcement sensible à l'exécution maintient ces relations malgré les erreurs de suivi en conditions dynamiques. Les auteurs évaluent l'approche via une étude de suivi multi-mouvements, une matrice couvrant différentes pentes de toit, une ablation à cinq configurations sur la tâche de cloueuse, des tests croisés sur le martelage et la poussée latérale, ainsi que des comparaisons avec un apprentissage par renforcement pur et une téléopération sans apprentissage préalable. Résultats obtenus : des erreurs de dégagement de travail comprises entre 0,256 et 0,531 cm, un taux de réussite de 3 sur 3 pour chaque tâche testée, et des erreurs moyennes de position du tronc inférieures à 80 mm lors des expériences physiques. L'intérêt de ces travaux tient au problème qu'ils ciblent : les surfaces inclinées et irrégulières du bâtiment restent l'un des terrains les plus difficiles pour les humanoïdes, bien plus exigeants que les sols plats des entrepôts où la plupart des démonstrations commerciales sont tournées. L'étude illustre aussi un écueil classique de l'apprentissage par imitation : retranscrire fidèlement un geste humain capturé ne garantit pas un placement correct des appuis par rapport à l'environnement réel, d'où l'ajout d'un ancrage explicite à un modèle de scène. Pour les intégrateurs et décideurs du BTP, ce résultat reste un signal de recherche amont plutôt qu'une preuve de déploiement : il indique une piste méthodologique crédible pour doter les humanoïdes de compétences de chantier extérieur, sans annoncer de produit ni de pilote commercial. Le travail s'appuie sur le Unitree G1, plateforme humanoïde chinoise largement utilisée par les laboratoires de recherche en robotique incarnée pour son coût réduit face à des concurrents comme Boston Dynamics ou Tesla Optimus. Il s'inscrit dans une vague plus large de recherches combinant apprentissage par imitation et renforcement pour le contrôle corps entier des humanoïdes, dans la lignée conceptuelle de projets industriels comme Helix de Figure AI ou GR00T N2 de NVIDIA, sans toutefois émaner d'un acteur commercial identifié : il s'agit d'une prépublication arXiv non encore validée par relecture par les pairs. Les auteurs présentent leur approche comme une base pour de futures primitives de mouvement humanoïde dédiées au bâtiment, sans calendrier de pilote ni partenariat annoncé à ce stade.

RecherchePaper
1 source