Aller au contenu principal
RechercheInteresting Engineering 

Robots humanoïdes réussissent un jeu complet de corde à sauter longue sans aide humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'Universite de Nanjing ont développe un système baptise Marope qui permet a des robots humanoïdes de jouer ensemble a la corde a sauter longue, sans intervention humaine : deux robots font tourner une corde partagée pendant qu'un troisième saute en rythme. Les résultats figurent dans un preprint accompagne de vidéos publiées sur une page projet dédiée. L'approche compte trois étages : une politique décentralisée, apprise par renforcement multi-agent, coordonne le mouvement de la corde entre les deux tourneurs ; une politique d'ordonnancement ajuste ensuite ces commandes en temps réel pour synchroniser la rotation avec le rythme du sauteur et éviter les collisions ; le robot sauteur a lui été entraine sur plusieurs styles de saut pour généraliser a différents partenaires. En simulation, Marope réduit les erreurs de suivi de la corde et le glissement des pieds face a des approches de référence, dont une version a agent unique pilotant les deux tourneurs. L'équipe a déployé le système sur des robots Unitree G1 réels, coordonnant avec succès des rotations humanoïde-humanoïde et humanoïde-humain, ainsi que des sauts mêlant participants humains et robotiques.

L'équipe présente ce travail comme une première : la coordination réussie de plusieurs robots humanoïdes sur une tache physique partagée aussi précise. Contrairement aux précédents projets de sport robotique (tennis de table, danse, course a pied), généralement portes par un seul robot agissant seul ou réagissant a un objet extérieur, la corde a sauter longue impose une véritable coopération entre deux agents qui manipulent un objet souple et imprévisible tout en gardant leur équilibre, et qui doivent en plus se synchroniser avec un troisième agent au rythme variable. Pour les chercheurs et intégrateurs en robotique, la démonstration illustre les progrès de l'apprentissage par renforcement multi-agent sur des taches ou plusieurs robots partagent le contrôle d'un objet physique instable, un scenario pertinent au-delà du jeu pour la manipulation collaborative en environnement industriel. Il s'agit néanmoins d'une preuve de concept de laboratoire, pas d'un produit commercial ni d'un déploiement en conditions réelles.

Le système tourne sur la plateforme humanoïde Unitree G1, du fabricant chinois Unitree Robotics, déjà largement utilisée comme banc d'essai par les laboratoires de recherche en robotique. Les chercheurs reconnaissent plusieurs limites : le cadre est conçu spécifiquement pour la corde a sauter longue et ne se généralisé pas automatiquement a d'autres taches coopératives entre humanoïdes ; le système actuel ne gère qu'un seul sauteur a la fois, et des formats plus complexes comme le double dutch restent non résolus. Surtout, l'ensemble repose sur un système de capture de mouvement externe pour suivre la corde et les participants, un dispositif qu'il faudrait remplacer par des capteurs embarques avant d'envisager une coordination réaliste entre humanoïdes et humains au quotidien, une piste que l'équipe présente comme un axe de travail futur.

Dans nos dossiers

À lire aussi

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes
1arXiv cs.RO 

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes

Une équipe de chercheurs du laboratoire DAVIAN a publié en juin 2026 PHUMA (Physically Reliable HUMAnoid locomotion dataset), un corpus de 73 heures de données de locomotion humanoide produit via un pipeline en deux étapes : une curation physiquement consciente suivie d'un retargeting contraint par des lois physiques. La base de données agrège à la fois des données de motion capture traditionnelles et des vidéos issues d'internet, les deux étant traitées pour éliminer les artefacts physiques récurrents dans les datasets existants, notamment le flottement, la pénétration géométrique et le foot skating. Entraînées sur PHUMA, les politiques de contrôle obtiennent des taux de succès supérieurs à ceux obtenus avec AMASS et Humanoid-X sur les benchmarks de motion tracking standards, et transfèrent en zero-shot vers un Unitree G1 réel. Le code et les données sont disponibles publiquement via davian-robotics.github.io/PHUMA. Le principal verrou que PHUMA prétend lever est la qualité physique des données d'entraînement pour l'imitation de mouvement humanoide. Les approches par imitation sont attractives parce qu'elles permettent d'acquérir des comportements naturels sans reward engineering fastidieux, mais leur efficacité dépend directement de la cohérence physique des données sources. Les artefacts présents dans les datasets basés sur des vidéos internet (comme Humanoid-X) se propagent dans les politiques entraînées, produisant des robots qui glissent ou oscillent de façon instable. La démonstration de transfert zero-shot sur un Unitree G1 physique est le point le plus concret : elle suggère que le filtrage physique en amont réduit effectivement le sim-to-real gap, sans fine-tuning additionnel sur hardware. Reste à qualifier l'ampleur du gain : les métriques de benchmarks internes ne se substituent pas à des comparaisons en conditions réelles standardisées. AMASS, publié en 2019, est resté longtemps la référence en motion capture humanoide, mais sa taille limitée et son coût d'acquisition ont freiné la scalabilité des approches data-driven. Humanoid-X a tenté de combler ce vide en exploitant des vidéos YouTube à grande échelle, au prix d'une dégradation qualitative. PHUMA s'inscrit dans une dynamique plus large où plusieurs équipes cherchent à constituer des datasets de locomotion humanoide à la fois volumineux et physiquement valides, en parallèle des travaux de Figure AI (Figure 03), Boston Dynamics, et des équipes derrière GR00T N2 chez NVIDIA. La prochaine étape logique serait de tester PHUMA sur d'autres plateformes humanoïdes commerciales (H1, Digit) et d'élargir les tâches au-delà de la locomotion simple vers la manipulation en déplacement.

UELe dataset PHUMA étant en accès libre, les équipes de recherche européennes en locomotion humanoïde (INRIA, CEA-List, LAAS-CNRS) peuvent l'intégrer directement dans leurs pipelines d'entraînement sans coût d'acquisition.

RecherchePaper
1 source
Un système pour des comportements loco-manipulatoires rapides, résilients et adaptatifs sur les robots humanoïdes
2arXiv cs.RO 

Un système pour des comportements loco-manipulatoires rapides, résilients et adaptatifs sur les robots humanoïdes

Des chercheurs de l'IHMC (Institute for Human and Machine Cognition) ont publié une thèse présentant un système de pilotage comportemental pour robots humanoïdes, conçu pour combiner locomotion et manipulation d'objets en temps réel dans des environnements industriels non structurés. Le système, déployé sur cinq plateformes distinctes, le DRC Atlas de Boston Dynamics, le Valkyrie de la NASA, le Nadia d'IHMC et Boardwalk Robotics, le H1-2 d'Unitree et l'Alex d'IHMC, permet à un opérateur de créer, modifier et superviser des comportements directement pendant l'exécution, sans arrêt du robot. La bibliothèque de comportements couvre plus de vingt variantes de tâches réelles : ouverture de portes à poignée rotative, barre anti-panique ou levier, séquences d'exploration multi-étapes, désencombrement d'obstacles et manipulation réactive de surface à surface. Ce travail s'attaque à l'un des verrous fondamentaux de la robotique humanoïde commerciale : la fragilité des comportements face à la variabilité du monde réel. En combinant des "Affordance Templates" centrés sur les objets, une logique inspirée des Behavior Trees et une couche de perception éditable à l'exécution, l'architecture permet d'adapter, d'étendre ou de composer des comportements existants en quelques minutes à quelques heures. C'est une rupture significative par rapport aux pipelines d'apprentissage bout-en-bout, type VLA (Vision-Language-Action), qui nécessitent des cycles d'entraînement longs pour toute nouvelle tâche. Le système repose sur un contrôleur corps-entier autorisant le mouvement des bras pendant la marche, avec un algorithme de superposition d'actions concurrentes pour accélérer les cycles. Le contexte académique est celui du DARPA Robotics Challenge (2013-2015), dont les principes de "Coactive Design", observabilité maximale, prédictibilité, directivité, ont structuré toute l'architecture. Cette thèse constitue une capitalisation de plusieurs années de déploiements multi-robots au sein de l'IHMC, laboratoire fédéral américain historiquement centré sur la locomotion bipède. Face aux approches concurrentes purement end-to-end de Figure AI, Physical Intelligence (pi0) ou Tesla Optimus, ce système positionne un pôle alternatif : contrôle symbolique hybride, intervention opérateur en boucle courte, portabilité multi-plateforme. La prochaine étape naturelle serait une intégration avec des politiques apprises pour les sous-tâches de manipulation fine, comblant le gap sim-to-real que ni l'approche symbolique ni l'apprentissage seul ne résolvent pleinement à ce stade.

RecherchePaper
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
3arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source
Robot Drummer : un humanoïde apprend les compétences rythmiques de la batterie
4arXiv cs.RO 

Robot Drummer : un humanoïde apprend les compétences rythmiques de la batterie

Des chercheurs ont présenté Robot Drummer, un framework de simulation permettant à des robots humanoïdes d'apprendre à jouer de la batterie, dans un article mis à jour sur arXiv (arXiv:2507.11498v3). L'équipe modélise le jeu de batterie comme une succession d'événements de contact minutés, baptisée "Rhythmic Contact Chain". Pour gérer la durée des morceaux, chaque piste est découpée en segments de longueur fixe, et une seule politique d'apprentissage par renforcement est entraînée en parallèle sur l'ensemble de ces segments plutôt que morceau par morceau. Les auteurs ont testé leur méthode sur plus de trente titres populaires et rapportent des scores F1 élevés, avec un apprentissage efficace même sur des performances musicales longues. Le système fait émerger des comportements proches de ceux d'un batteur humain, comme les frappes en croisant les bras ou une répartition adaptative des baguettes entre les mains. Le projet reste pour l'instant purement simulé, sans déploiement sur un robot physique ; une page dédiée (robotdrummer.github.io) présente les résultats. L'intérêt de ces travaux dépasse le simple exercice de style musical. La batterie impose une contrainte rare dans la robotique humanoïde : une synchronisation à la fraction de seconde, des contacts répétés à grande vitesse, et une coordination fine entre plusieurs membres sur des durées de plusieurs minutes, bien au-delà des tâches de manipulation ou de locomotion habituellement étudiées. Démontrer qu'une politique de RL unique peut apprendre ce type de comportement long et précis constitue un test de charge utile pour les architectures de contrôle destinées, à terme, à des tâches industrielles exigeant elles aussi rapidité et coordination multi-membres sous contrainte de timing strict. Les humanoïdes ont beaucoup progressé ces dernières années sur l'équilibre, la marche et la préhension d'objets, mais les domaines expressifs comme la performance artistique restaient largement inexplorés. Ce travail s'inscrit dans une tendance plus large consistant à utiliser des tâches créatives ou ludiques comme bancs d'essai pour la dextérité et la coordination robotique. La prochaine étape logique, non abordée dans cette publication, serait le transfert de cette politique de simulation vers un robot physique réel, avec les défis classiques de sim-to-real que cela implique.

RecherchePaper
1 source