Aller au contenu principal
RecherchearXiv cs.RO 

Extreme-RGMT : apprentissage continu de compétences hautement dynamiques pour un contrôle humanoïde généraliste robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Voici l'article :

Une équipe de recherche publie sur arXiv le framework Extreme-RGMT, une méthode d'apprentissage continu en deux étapes destinée au contrôle de robots humanoïdes généralistes. La première étape entraîne une politique de suivi de mouvement généraliste à partir de données de mouvement multi-sources diverses. La seconde étape introduit un mécanisme asymétrique d'acquisition de compétences et de consolidation des capacités, qui limite la dérive de la politique sur les mouvements déjà maîtrisés tout en concentrant l'apprentissage sur les segments dynamiques difficiles. Pour pallier la rareté des mouvements très dynamiques et leur fort taux d'échec à l'entraînement, les auteurs combinent un échantillonnage sensible à la difficulté avec un rééchantillonnage de trajectoires priorisé par l'avantage. Résultat annoncé : des performances état de l'art en suivi de mouvement corps entier généraliste, avec une nette amélioration du taux de réussite sur les mouvements dynamiques rares, le contrôleur final exécutant des mouvements inédits sous références fixes et sous entrées de capture de mouvement inertielle en ligne.

L'enjeu dépassé ici est un compromis classique et bloquant du secteur : les politiques généralistes de suivi de mouvement échouent souvent sur les gestes rares et acrobatiques, tandis que le fine-tuning spécialisé sur ces gestes fait régresser les comportements courants déjà acquis, un phénomène d'oubli catastrophique bien connu en apprentissage continu. Si les résultats se confirment au-delà du papier, cela réduit un frein concret à la commercialisation des humanoïdes généralistes, où les intégrateurs veulent un seul contrôleur capable à la fois de gestes du quotidien fiables et de réactions dynamiques ponctuelles, sans devoir maintenir des politiques séparées ni recertifier le comportement de base à chaque ajout de compétence.

Le travail s'inscrit dans la lignée des recherches sur le suivi de mouvement corps entier pour humanoïdes, où des approches génériques par imitation ou par capture de mouvement sont couramment utilisées pour transférer des mouvements humains vers des robots. Extreme-RGMT ne s'appuie pas sur des données terrain ni sur un déploiement industriel : il s'agit d'une contribution méthodologique en simulation ou banc d'essai contrôlé, publiée en preprint (arXiv:2607.20110), sans partenaire industriel ni plateforme matérielle nommée dans le résumé. Les suites logiques attendues seraient une validation sur robot physique réel et une comparaison directe avec les contrôleurs généralistes existants du secteur.

Dans nos dossiers

À lire aussi

KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques
1arXiv cs.RO 

KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques

Des chercheurs présentent KungfuBot, un cadre de contrôle corps-entier pour robots humanoïdes basé sur la physique, capable d'imiter des mouvements humains hautement dynamiques comme le kungfu ou la danse, là où les algorithmes existants ne parviennent à suivre que des mouvements lents et fluides malgré un travail soigné sur les récompenses et le curriculum d'apprentissage. Le système repose sur un pipeline de traitement du mouvement qui extrait, filtre, corrige et retargete les captures de mouvement humain tout en respectant au maximum les contraintes physiques du robot. Pour l'imitation, les auteurs formulent un problème d'optimisation à deux niveaux qui ajuste dynamiquement la tolérance de précision de suivi selon l'erreur courante, créant un mécanisme de curriculum adaptatif, complété par une architecture acteur-critique asymétrique pour l'entraînement des politiques. Déployé sur le robot Unitree G1, le système atteint des erreurs de suivi nettement inférieures aux approches existantes et produit des comportements stables et expressifs. Le projet est documenté sur kungfubot.github.io. L'enjeu dépasse la simple prouesse technique : la capacité à reproduire des mouvements rapides et dynamiques est un point de blocage connu du contrôle corps-entier par imitation, où le compromis entre stabilité physique et fidélité au mouvement source devient critique à haute vitesse. En démontrant qu'un curriculum adaptatif basé sur l'erreur de suivi permet de dépasser ce plafond, KungfuBot apporte une preuve de concept utile pour toute l'industrie humanoïde, où l'expressivité et la robustesse des mouvements dynamiques sont devenues un argument de démonstration autant qu'un vrai défi d'ingénierie. Reste que les vidéos de démonstration, comme souvent dans ce type de publication, présentent probablement une sélection de résultats plutôt qu'un comportement systématique et généralisable. Ce travail s'inscrit dans la lignée des recherches sur l'imitation de mouvement par apprentissage par renforcement physique, un domaine où le retargeting de capture de mouvement humain vers des morphologies robotiques reste une difficulté majeure. Le fait qu'il s'agisse d'une troisième version révisée sur arXiv suggère un travail affiné après retours de la communauté. Le choix du Unitree G1, plateforme largement utilisée dans la recherche académique en robotique humanoïde, positionne ces résultats comme reproductibles par d'autres laboratoires, dans un secteur où Unitree, Figure ou Boston Dynamics rivalisent sur la démonstration de comportements dynamiques et expressifs.

RecherchePaper
1 source
Politique de contrainte de surface pour l'apprentissage de compétences robotiques contraintes et dynamiquement réalisables
2arXiv cs.RO 

Politique de contrainte de surface pour l'apprentissage de compétences robotiques contraintes et dynamiquement réalisables

Des chercheurs ont déposé en mai 2026 sur arXiv (identifiant 2605.31321) un article présentant la Surface Constraint Policy (SCP), une méthode destinée à améliorer la fiabilité des robots dans des tâches de manipulation dextre impliquant des contraintes de surface complexes et de forme libre. L'approche encode la géométrie de surface à partir de démonstrations humaines via une fonction noyau gaussien pondérée en deux dimensions. Sur cette base, une politique de diffusion infère des intentions d'action à partir d'entrées multimodales (observations visuelles et retour d'état du robot), qui sont ensuite transformées en primitives de mouvement dynamique contraintes à la surface (DMPs, Dynamic Movement Primitives) via une méthode de mapping par similarité. Ce pipeline produit des trajectoires à la fois géométriquement admissibles et dynamiquement réalisables. Les auteurs font état de taux de succès et d'une stabilité de contact supérieurs aux méthodes comparées, sans que le résumé ne détaille les métriques précises ni les benchmarks utilisés. Ce travail pointe un angle mort persistant des approches actuelles d'apprentissage par imitation à base de diffusion : les politiques classiques génèrent des actions de manière stochastique, sans modéliser explicitement la géométrie de la surface de contact. En pratique, cela se traduit par des glissements, des décrochages ou des trajectoires physiquement inadmissibles, problèmes rédhibitoires pour des applications industrielles comme le polissage, l'assemblage surfacique ou le soudage. L'originalité de SCP tient à l'intégration des contraintes géométriques dès la génération d'action, couplée à des DMPs qui garantissent la faisabilité dynamique. Pour les intégrateurs et les équipes R&D, cette approche représente un pas concret vers la répétabilité requise en production, là où la stabilité du contact prime sur la généralisation toutes-tâches. Ce travail s'inscrit dans une vague de recherche intense autour des politiques de diffusion pour la manipulation robotique, initiée par Diffusion Policy (Chi et al., 2023, Columbia University) et accélérée par des acteurs comme Physical Intelligence avec pi0, Google DeepMind avec RT-2, ou encore ACT de Stanford. Les primitives de mouvement dynamique mobilisées ici sont un outil classique de la robotique depuis les travaux de Schaal dans les années 2000, mais leur couplage avec un pipeline de diffusion moderne pour gérer des contraintes surfaciques constitue l'apport original de la méthode. Les limitations pointées par les auteurs sont partagées par la plupart des architectures VLA actuelles, ce qui signale un axe de recherche pertinent pour quiconque vise le déploiement industriel. Les prochaines étapes naturelles incluraient une validation sur des surfaces déformables ou en mouvement, ainsi qu'un test de passage à l'échelle avec une plus grande diversité de tâches et de morphologies robotiques.

RecherchePaper
1 source
Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif
3arXiv cs.RO 

Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif

Des chercheurs ont proposé un modèle de dynamique contextuel fondé sur les équations différentielles ordinaires neuronales (Neural ODE) pour améliorer le contrôle de robots opérant dans des environnements incertains et variables. Le travail, déposé en juin 2026 sur arXiv (référence 2606.15469), cible les perturbations que les contrôleurs classiques peinent à absorber: variations des conditions de contact, effets aérodynamiques et perturbations externes imprévues. La méthode repose sur une procédure d'entraînement en deux phases: le modèle inspecte l'historique des états et des actions du robot pour inférer les facteurs environnementaux courants, sans capteurs dédiés supplémentaires. La compatibilité avec le MPC (Model Predictive Control) est intégrée dès la conception. Les validations portent sur trois plateformes distinctes: un drone quadrirotor en simulation, un robot sphérique Sphero BOLT et un bras manipulateur industriel Fanuc, ces deux derniers testés en conditions réelles. L'enjeu central est la dérive de modèle lors du déploiement: un robot calibré en laboratoire voit ses performances se dégrader dès que l'environnement change, que ce soit un sol différent, une charge variable ou des turbulences. Par rapport aux approches récurrentes classiques (LSTM, GRU), les Neural ODE présentent un avantage structurel: elles modélisent la dynamique en temps continu, ce qui améliore la cohérence physique et simplifie l'interface avec les solveurs MPC. L'inférence du contexte depuis le seul historique actions-états, sans instrumentation additionnelle, réduit la barrière d'intégration pour les industriels. Le test sur un Fanuc, bras omniprésent en production manufacturière, ancre les résultats dans une réalité opérationnelle tangible. Point de réserve: l'article est un preprint et l'abstract ne publie aucune métrique chiffrée de performance, ce qui rend l'évaluation indépendante difficile à ce stade. Les Neural ODE ont été introduites en 2018 par Chen et al. (NeurIPS) comme alternative aux réseaux récurrents pour modéliser des systèmes dynamiques continus. Leur application au contrôle robotique adaptatif répond à un obstacle persistant du secteur: le sim-to-real gap, qui fragilise la fiabilité des systèmes autonomes hors conditions contrôlées. Les approches concurrentes comprennent les processus gaussiens (GP) pour l'adaptation en ligne, les algorithmes méta-apprenants (MAML, PEARL) et l'identification de systèmes en temps réel. Ce travail se distingue par l'inférence contextuelle implicite, couplée nativement au MPC plutôt qu'ajoutée en couche. Le code source est ouvert sur GitHub et des démonstrations vidéo sont accessibles. La prochaine étape logique serait une validation sur des tâches de manipulation à charge variable ou un déploiement en environnement industriel non contrôlé.

RecherchePaper
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
4arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source