Aller au contenu principal
APEX : apprentissage adaptatif de la traversée de plateformes hautes pour robots humanoïdes
RecherchearXiv cs.RO 

APEX : apprentissage adaptatif de la traversée de plateformes hautes pour robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un système baptisé APEX permet à des robots humanoïdes de franchir des plateformes plus hautes que leurs jambes en grimpant plutôt qu'en sautant, selon un article publié sur arXiv (2602.11143v3). Testé sur un robot Unitree G1 à 29 degrés de liberté, il réalise en zero-shot, c'est-à-dire sans réentraînement après la simulation, le franchissement de plateformes de 0,8 mètre, soit environ 114 % de la longueur des jambes du robot. Le système combine six comportements, montée et descente sur arêtes verticales, marche ou reptation sur la plateforme, mise debout et allongement, fusionnés en une seule politique qui choisit et enchaîne automatiquement ces compétences selon la géométrie locale perçue par un capteur LiDAR. Son innovation centrale est une "récompense de progression à cliquet", qui suit la meilleure avancée atteinte dans la tâche et pénalise tout recul, offrant un signal d'apprentissage dense sans dépendre de la vitesse.

Le résultat comble un angle mort connu de l'apprentissage par renforcement appliqué à la locomotion humanoïde : les politiques entraînées pour franchir des obstacles hauts convergent généralement vers des sauts à fort impact, gourmands en couple et jugés trop dangereux pour un usage réel. En démontrant un franchissement fiable au-delà de la longueur des jambes via une escalade contrôlée, APEX étend le champ d'action des humanoïdes hors de la simple marche sur terrain accidenté, un enjeu concret pour les intégrateurs visant l'entrepôt, le chantier ou l'intervention en environnement non structuré, où quais et plateformes verticales restent des obstacles fréquents. La correction de l'écart simulation-réel, obtenue en modélisant les artefacts de cartographie à l'entraînement puis en filtrant et reconstruisant les cartes d'élévation au déploiement, illustre une approche de plus en plus répandue pour fiabiliser les tâches de contact riche sans multiplier les démonstrations vidéo sélectionnées.

Ce travail s'inscrit dans la progression rapide de la locomotion humanoïde par apprentissage par renforcement, déjà capable de marche robuste sur terrain irrégulier mais jusqu'ici limitée par la portée des jambes. Le recours au Unitree G1, plateforme matérielle courante en recherche académique, situe APEX comme une contribution scientifique plutôt qu'un produit commercial : il s'agit d'une publication arXiv en version 3, de type "replace" (mise à jour d'un travail déjà soumis), sans annonce de partenariat industriel, de pilote ni de calendrier de commercialisation. Les suites attendues pour ce type de recherche portent généralement sur l'extension à des terrains plus variés et la validation sur d'autres plateformes matérielles, dans un secteur où la course se joue de plus en plus autour de politiques généralistes de type VLA, vision-language-action, capables de généraliser au-delà d'une tâche unique.

Dans nos dossiers

À lire aussi

Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture
1arXiv cs.RO 

Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture

Un article publié sur arXiv (référence 2609.20558v1) présente un cadre logiciel permettant à un robot humanoïde Unitree G1 d'exécuter des tâches de couvreur sur toitures en pente : marche en montée, utilisation d'une cloueuse pneumatique, martelage et mouvements de flexion. La méthode capture des démonstrations humaines par un système de suivi de mouvement, les retranscrit sur le robot, puis s'appuie sur un modèle métrique 3D du toit pour ancrer précisément les points de contact des pieds et des mains ainsi que les relations de travail (distance à l'outil, zones de dégagement) à la surface réelle. Une optimisation au niveau de la trajectoire fixe ces contraintes, tandis qu'un apprentissage par renforcement sensible à l'exécution maintient ces relations malgré les erreurs de suivi en conditions dynamiques. Les auteurs évaluent l'approche via une étude de suivi multi-mouvements, une matrice couvrant différentes pentes de toit, une ablation à cinq configurations sur la tâche de cloueuse, des tests croisés sur le martelage et la poussée latérale, ainsi que des comparaisons avec un apprentissage par renforcement pur et une téléopération sans apprentissage préalable. Résultats obtenus : des erreurs de dégagement de travail comprises entre 0,256 et 0,531 cm, un taux de réussite de 3 sur 3 pour chaque tâche testée, et des erreurs moyennes de position du tronc inférieures à 80 mm lors des expériences physiques. L'intérêt de ces travaux tient au problème qu'ils ciblent : les surfaces inclinées et irrégulières du bâtiment restent l'un des terrains les plus difficiles pour les humanoïdes, bien plus exigeants que les sols plats des entrepôts où la plupart des démonstrations commerciales sont tournées. L'étude illustre aussi un écueil classique de l'apprentissage par imitation : retranscrire fidèlement un geste humain capturé ne garantit pas un placement correct des appuis par rapport à l'environnement réel, d'où l'ajout d'un ancrage explicite à un modèle de scène. Pour les intégrateurs et décideurs du BTP, ce résultat reste un signal de recherche amont plutôt qu'une preuve de déploiement : il indique une piste méthodologique crédible pour doter les humanoïdes de compétences de chantier extérieur, sans annoncer de produit ni de pilote commercial. Le travail s'appuie sur le Unitree G1, plateforme humanoïde chinoise largement utilisée par les laboratoires de recherche en robotique incarnée pour son coût réduit face à des concurrents comme Boston Dynamics ou Tesla Optimus. Il s'inscrit dans une vague plus large de recherches combinant apprentissage par imitation et renforcement pour le contrôle corps entier des humanoïdes, dans la lignée conceptuelle de projets industriels comme Helix de Figure AI ou GR00T N2 de NVIDIA, sans toutefois émaner d'un acteur commercial identifié : il s'agit d'une prépublication arXiv non encore validée par relecture par les pairs. Les auteurs présentent leur approche comme une base pour de futures primitives de mouvement humanoïde dédiées au bâtiment, sans calendrier de pilote ni partenariat annoncé à ce stade.

RecherchePaper
1 source
Apprentissage par renforcement résiduel guidé par la physique pour la traversée de chemins étroits par humanoïdes
2arXiv cs.RO 

Apprentissage par renforcement résiduel guidé par la physique pour la traversée de chemins étroits par humanoïdes

Une équipe de recherche a publié une nouvelle version (v5) d'un article arXiv (2508.20661) décrivant une méthode d'apprentissage par renforcement en deux étapes pour la traversée de chemins étroits par des robots humanoïdes, terrain où les approches purement basées sur des templates physiques ou purement par renforcement échouent généralement. La première étape combine un planificateur d'appuis au sol issu d'un template physique avec un contrôleur bas niveau de suivi de trajectoire ; la seconde ajoute un module léger de correction des appuis assisté par perception, entraîné selon un curriculum progressif allant du sol plat aux chemins étroits. Testée sur un robot humanoïde Unitree G1, la méthode a permis de franchir sans échec, à 20 reprises consécutives, une poutre de 0,2 mètre de large et 3 mètres de long. Le résultat s'attaque à un problème concret pour l'industrie robotique : le placement précis des pieds sur des appuis rares et critiques pour la sécurité, comme des passerelles ou poutrelles de chantier, reste un point faible connu des humanoïdes malgré des démonstrations vidéo souvent flatteuses. En associant l'interprétabilité d'un planificateur physique classique à la capacité de généralisation du renforcement, les auteurs revendiquent un meilleur taux de réussite, une meilleure adhérence à la trajectoire centrale et de meilleures marges de sécurité que les approches purement template ou purement RL, avec un transfert simulateur-vers-réel facilité, obstacle récurrent pour le secteur. Pour les intégrateurs évaluant des humanoïdes sur chantiers ou sites industriels contraints, ces résultats restent une preuve de concept en laboratoire, limitée à une seule configuration de poutre testée 20 fois, loin d'une validation en déploiement réel. Ces travaux s'inscrivent dans un effort de recherche plus large visant à réduire l'écart entre les démonstrations soignées de locomotion humanoïde, qu'il s'agisse de Figure 03, d'Optimus chez Tesla ou des modèles Unitree, et une robustesse réellement transférable sur terrain contraint. Le choix du G1 d'Unitree, humanoïde compact et abordable très utilisé par les laboratoires académiques, confirme son rôle de plateforme de référence pour la recherche sur la locomotion, face à des systèmes plus coûteux comme l'Atlas de Boston Dynamics. Aucun acteur français ou européen n'intervient dans cette publication, qui reste à ce stade une contribution académique en preprint sur arXiv, sans calendrier de transfert industriel ni partenariat commercial annoncé.

RecherchePaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
3arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
Apprentissage de compétences de badminton proches de l'humain pour robots humanoïdes
4arXiv cs.RO 

Apprentissage de compétences de badminton proches de l'humain pour robots humanoïdes

Un article de recherche révisé sur arXiv (2602.08370v2) présente "Imitation-to-Interaction" (I2I), un framework d'apprentissage par renforcement progressif qui apprend à un robot humanoïde à jouer au badminton. La méthode construit d'abord un a priori moteur à partir de données de mouvement humain, le compresse en une représentation d'état compacte basée sur un modèle, puis stabilise la dynamique via des a priori adversariaux. Une stratégie d'expansion de variété (manifold expansion) généralise ensuite les points de frappe, rares dans les démonstrations expertes disponibles, en un volume d'interaction dense permettant d'intercepter le volant dans une zone continue plutôt qu'à des positions figées. En simulation, le robot maîtrise plusieurs coups caractéristiques comme les lifts (dégagés hauts) et les amortis courts (drop shots). Les auteurs revendiquent le premier transfert "zero-shot" simulation-vers-réel de ces gestes sur un robot humanoïde physique, sans préciser dans le résumé la plateforme utilisée, le nombre de degrés de liberté ni de taux de réussite des frappes. Le badminton combine une coordination corporelle explosive proche de la limite biomécanique et une interception où le timing se compte en dizaines de millisecondes, un défi bien supérieur à celui de la marche ou de la préhension statique en usine. L'enjeu dépasse le sport: la recherche en imitation de mouvement produit souvent des démonstrations visuellement convaincantes mais déconnectées de toute interaction physique fonctionnelle avec un objet dynamique. En affichant un transfert sim-to-real zero-shot sur une frappe à haute vitesse, ce travail s'attaque à l'un des goulots d'étranglement les plus cités du secteur humanoïde, l'écart persistant entre performance simulée et robustesse en conditions réelles. Pour les intégrateurs et décideurs évaluant la maturité des humanoïdes au-delà du pick-and-place répétitif, ce résultat suggère que des architectures combinant a priori de mouvement humain et modèles de dynamique commencent à généraliser à des gestes rapides, précis et non répétitifs. Ce travail prolonge une lignée de recherches en apprentissage par renforcement pour humanoïdes s'appuyant sur des a priori de mouvement adversariaux, technique utilisée pour ancrer des politiques de contrôle dans des captures de mouvement humain sans sacrifier le naturel du geste. Publiée en version révisée sur arXiv, la contribution reste académique à ce stade: le résumé ne cite aucun partenaire industriel, aucune plateforme robotique commerciale ni aucun site de déploiement, et rien n'indique de calendrier de mise en production. Elle s'inscrit dans un mouvement plus large de laboratoires testant la dextérité dynamique des humanoïdes via des tâches sportives, en complément des benchmarks classiques de locomotion et de manipulation statique.

RecherchePaper
1 source