Aller au contenu principal
Apprentissage par renforcement résiduel guidé par la physique pour la traversée de chemins étroits par humanoïdes
RecherchearXiv cs.RO 

Apprentissage par renforcement résiduel guidé par la physique pour la traversée de chemins étroits par humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié une nouvelle version (v5) d'un article arXiv (2508.20661) décrivant une méthode d'apprentissage par renforcement en deux étapes pour la traversée de chemins étroits par des robots humanoïdes, terrain où les approches purement basées sur des templates physiques ou purement par renforcement échouent généralement. La première étape combine un planificateur d'appuis au sol issu d'un template physique avec un contrôleur bas niveau de suivi de trajectoire ; la seconde ajoute un module léger de correction des appuis assisté par perception, entraîné selon un curriculum progressif allant du sol plat aux chemins étroits. Testée sur un robot humanoïde Unitree G1, la méthode a permis de franchir sans échec, à 20 reprises consécutives, une poutre de 0,2 mètre de large et 3 mètres de long.

Le résultat s'attaque à un problème concret pour l'industrie robotique : le placement précis des pieds sur des appuis rares et critiques pour la sécurité, comme des passerelles ou poutrelles de chantier, reste un point faible connu des humanoïdes malgré des démonstrations vidéo souvent flatteuses. En associant l'interprétabilité d'un planificateur physique classique à la capacité de généralisation du renforcement, les auteurs revendiquent un meilleur taux de réussite, une meilleure adhérence à la trajectoire centrale et de meilleures marges de sécurité que les approches purement template ou purement RL, avec un transfert simulateur-vers-réel facilité, obstacle récurrent pour le secteur. Pour les intégrateurs évaluant des humanoïdes sur chantiers ou sites industriels contraints, ces résultats restent une preuve de concept en laboratoire, limitée à une seule configuration de poutre testée 20 fois, loin d'une validation en déploiement réel.

Ces travaux s'inscrivent dans un effort de recherche plus large visant à réduire l'écart entre les démonstrations soignées de locomotion humanoïde, qu'il s'agisse de Figure 03, d'Optimus chez Tesla ou des modèles Unitree, et une robustesse réellement transférable sur terrain contraint. Le choix du G1 d'Unitree, humanoïde compact et abordable très utilisé par les laboratoires académiques, confirme son rôle de plateforme de référence pour la recherche sur la locomotion, face à des systèmes plus coûteux comme l'Atlas de Boston Dynamics. Aucun acteur français ou européen n'intervient dans cette publication, qui reste à ce stade une contribution académique en preprint sur arXiv, sans calendrier de transfert industriel ni partenariat commercial annoncé.

À lire aussi

ResSafe : filtrage de sécurité par apprentissage par renforcement résiduel pour humanoïdes
1arXiv cs.RO 

ResSafe : filtrage de sécurité par apprentissage par renforcement résiduel pour humanoïdes

ResSafe, une architecture de contrôle en deux politiques pour les robots humanoïdes, a été publiée le 15 septembre 2026 sur arXiv sous la référence 2609.15988. La méthode sépare performance et sécurité : une politique nominale est entraînée uniquement pour accomplir la tâche, tandis qu'une politique résiduelle apprend en parallèle des corrections de sécurité qui ajustent ses actions. Cette seconde politique agit comme un filtre de sécurité implicite, censé limiter chutes et instabilités liées à la dynamique à haute dimensionnalité et aux interactions riches en contacts propres aux humanoïdes. L'abstract ne cite aucune plateforme robotique ni aucun chiffre de performance (taux de chute, distance parcourue, degrés de liberté), signe d'une recherche encore amont, sans validation matérielle détaillée. Pour l'industrie, ce découplage répond à un problème connu : faire arbitrer par une seule politique performance, robustesse et sécurité oblige à régler manuellement plusieurs termes de récompense concurrents, un exercice fragile qui complique le passage du simulateur au robot réel. En sortant la sécurité de cette équation unique, ResSafe propose une approche modulaire qui, si elle se confirme sur du matériel, pourrait faciliter l'ajout de correctifs de sécurité sans réentraîner toute la politique de locomotion. L'enjeu parle directement aux intégrateurs et décideurs du secteur, confrontés à un écart persistant entre démonstrations en simulation et fiabilité en conditions réelles. Le travail s'inscrit dans une recherche académique plus large sur le contrôle par apprentissage des humanoïdes, où le RL pour la locomotion et le suivi de mouvement s'est largement généralisé ces dernières années. Il se distingue des méthodes de filtrage de sécurité explicite, fondées sur des barrières de contrôle ou des modèles analytiques de la dynamique, souvent coûteuses ou difficiles à généraliser à un système aussi complexe. L'article ne mentionne ni code source, ni partenaire industriel, ni calendrier d'essais sur robot physique : ResSafe reste, à ce stade, une contribution de recherche dont l'apport devra être confirmé au-delà de la simulation.

RecherchePaper
1 source
RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement
2arXiv cs.RO 

RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement

Une équipe de recherche a publié sur arXiv (référence 2606.25123) une architecture de contrôle hybride baptisée RGB, pour "RL Guided whole-body MPPI", destinée aux robots humanoïdes évoluant dans des environnements à contacts complexes. Le framework a été évalué en simulation MuJoCo sur un Unitree G1 à 29 degrés de liberté, avec une fréquence de contrôle moyenne de 280 Hz. Le principe : au lieu d'utiliser une politique d'apprentissage par renforcement (RL) comme contrôleur final, RGB l'emploie comme prior d'échantillonnage pour guider les rollouts d'un algorithme MPPI (Model Predictive Path Integral). Les objectifs de tâche sont définis via des termes de coût modulaires MPPI, qui corrigent en ligne la politique RL pour satisfaire ces objectifs sans nécessiter de réentraînement. Les tests montrent une réduction de la dérive systématique en marche rectiligne et une meilleure capacité à suivre des signaux de référence corps entier supplémentaires, comparé à une politique RL pure sous la même interface de commande. L'intérêt industriel de cette approche réside dans la rigidité structurelle des politiques RL actuelles : une fois entraînée, une politique couple fortement son comportement à l'objectif d'entraînement et à l'interface de commande. Ajouter un nouvel objectif de feedback (correction de trajectoire, contrainte de contact, suivi d'un membre spécifique) exige généralement un réentraînement complet, coûteux et long. RGB court-circuite cette contrainte en déléguant la précision et la modularité au MPPI, qui opère en boucle fermée à haute fréquence. Pour un intégrateur industriel ou un COO qui doit adapter un humanoïde à plusieurs lignes de production, la possibilité de spécifier de nouveaux comportements via des termes de coût, sans retouch au modèle RL sous-jacent, représente un gain de flexibilité concret. La fréquence de 280 Hz en simulation est encourageante, mais les auteurs ne démontrent pas encore le transfert sim-to-real, ce qui reste le saut critique pour toute validation industrielle. Le cadre MPPI est une technique de contrôle prédictif par échantillonnage bien établie en robotique mobile et manipulation, mais son couplage avec une politique RL comme prior pour les humanoïdes corps entier est une direction récente. Unitree, dont le G1 est devenu une plateforme de recherche courante grâce à son accessibilité commerciale (autour de 16 000 dollars), est au coeur de nombreux travaux académiques concurrents, notamment autour des architectures VLA (Vision-Language-Action) de type GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. RGB se positionne dans un créneau distinct : il ne vise pas la généralisation via des données de démonstration, mais l'optimisation en ligne de politiques existantes. La prochaine étape logique sera une validation sur hardware réel, déterminante pour établir si les 280 Hz de simulation se maintiennent face aux incertitudes mécaniques et aux latences capteurs d'un vrai G1.

RecherchePaper
1 source
Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons
3arXiv cs.RO 

Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons

Res-HIL, un framework de reinforcement learning résiduel guidé par l'humain pour la manipulation robotique dextre, a été publié sur arXiv le 25 septembre 2026 sous la référence 2609.30023. La méthode combine une politique d'imitation pré-entraînée et gelée avec une politique résiduelle corrective, entraînée à partir d'interventions humaines en temps réel : chaque intervention fournit à la fois une supervision directe de la politique résiduelle et un signal de récompense pour le comportement autonome qui l'a précédée. La politique résiduelle démarre à zéro pour stabiliser l'apprentissage en ligne. Testée sur cinq tâches de manipulation à fort contact, mêlant haute précision et longs horizons temporels, Res-HIL surpasse, avec seulement 20 démonstrations initiales et dix minutes d'entraînement en ligne, les méthodes de référence de RL human-in-the-loop à politique complète et de fine-tuning résiduel sans guidage humain. Elle dépasse également des politiques d'imitation pure entraînées avec cinq fois plus de démonstrations. Le résultat cible le principal goulot d'étranglement du déploiement de manipulateurs dextres : le coût de collecte de démonstrations humaines, qui ne garantit pas la généralisation une fois la politique déployée hors distribution. En montrant qu'une correction résiduelle guidée par l'humain, appliquée seulement dix minutes, peut égaler des politiques entraînées sur cinq fois plus de données, Res-HIL suggère que l'effort humain est mieux investi dans la correction ciblée d'une politique existante que dans la multiplication des démonstrations complètes, une remise en cause pratique de l'hypothèse dominante en apprentissage par imitation selon laquelle la qualité dépend avant tout du volume de données. Pour les intégrateurs évaluant des tâches à fort contact comme l'assemblage ou l'insertion, cela ouvre une voie d'amélioration post-déploiement moins coûteuse qu'un ré-entraînement complet. L'approche s'inscrit entre deux courants existants : l'apprentissage par imitation, dont les politiques échouent typiquement hors de la distribution des démonstrations d'entraînement, et le RL human-in-the-loop, qui exploite des corrections en ligne mais réapprend généralement une politique complète plutôt que d'affiner un modèle déjà entraîné. Res-HIL se positionne explicitement contre ces deux références, qu'il surpasse systématiquement dans l'étude comparative. Une analyse d'ablation montre que la supervision directe de la politique résiduelle est le facteur critique de performance, tandis que le façonnage de récompense sensible aux interventions améliore surtout l'efficacité de l'entraînement. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche méthodologique dont la validation sur des plateformes robotiques réelles, au-delà des cinq tâches testées, reste l'étape suivante.

RecherchePaper
1 source
APEX : apprentissage adaptatif de la traversée de plateformes hautes pour robots humanoïdes
4arXiv cs.RO 

APEX : apprentissage adaptatif de la traversée de plateformes hautes pour robots humanoïdes

Un système baptisé APEX permet à des robots humanoïdes de franchir des plateformes plus hautes que leurs jambes en grimpant plutôt qu'en sautant, selon un article publié sur arXiv (2602.11143v3). Testé sur un robot Unitree G1 à 29 degrés de liberté, il réalise en zero-shot, c'est-à-dire sans réentraînement après la simulation, le franchissement de plateformes de 0,8 mètre, soit environ 114 % de la longueur des jambes du robot. Le système combine six comportements, montée et descente sur arêtes verticales, marche ou reptation sur la plateforme, mise debout et allongement, fusionnés en une seule politique qui choisit et enchaîne automatiquement ces compétences selon la géométrie locale perçue par un capteur LiDAR. Son innovation centrale est une "récompense de progression à cliquet", qui suit la meilleure avancée atteinte dans la tâche et pénalise tout recul, offrant un signal d'apprentissage dense sans dépendre de la vitesse. Le résultat comble un angle mort connu de l'apprentissage par renforcement appliqué à la locomotion humanoïde : les politiques entraînées pour franchir des obstacles hauts convergent généralement vers des sauts à fort impact, gourmands en couple et jugés trop dangereux pour un usage réel. En démontrant un franchissement fiable au-delà de la longueur des jambes via une escalade contrôlée, APEX étend le champ d'action des humanoïdes hors de la simple marche sur terrain accidenté, un enjeu concret pour les intégrateurs visant l'entrepôt, le chantier ou l'intervention en environnement non structuré, où quais et plateformes verticales restent des obstacles fréquents. La correction de l'écart simulation-réel, obtenue en modélisant les artefacts de cartographie à l'entraînement puis en filtrant et reconstruisant les cartes d'élévation au déploiement, illustre une approche de plus en plus répandue pour fiabiliser les tâches de contact riche sans multiplier les démonstrations vidéo sélectionnées. Ce travail s'inscrit dans la progression rapide de la locomotion humanoïde par apprentissage par renforcement, déjà capable de marche robuste sur terrain irrégulier mais jusqu'ici limitée par la portée des jambes. Le recours au Unitree G1, plateforme matérielle courante en recherche académique, situe APEX comme une contribution scientifique plutôt qu'un produit commercial : il s'agit d'une publication arXiv en version 3, de type "replace" (mise à jour d'un travail déjà soumis), sans annonce de partenariat industriel, de pilote ni de calendrier de commercialisation. Les suites attendues pour ce type de recherche portent généralement sur l'extension à des terrains plus variés et la validation sur d'autres plateformes matérielles, dans un secteur où la course se joue de plus en plus autour de politiques généralistes de type VLA, vision-language-action, capables de généraliser au-delà d'une tâche unique.

RecherchePaper
1 source