Aller au contenu principal
Synthèse naturelle du mouvement assis-debout pour humanoïdes via curriculum d'assistance guidée et récompenses par étapes
RecherchearXiv cs.RO 

Synthèse naturelle du mouvement assis-debout pour humanoïdes via curriculum d'assistance guidée et récompenses par étapes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie un article arXiv (arXiv:2608.20823, mis en ligne le 24 aout 2026) qui présente une méthode d'apprentissage par renforcement pour générer un mouvement naturel de passage assis-debout (sit-to-stand, STS) chez un humanoïde, sans aucune démonstration humaine ni trajectoire de référence. Une politique unique, entraînée par Proximal Policy Optimisation (PPO), combine trois mécanismes: un curriculum couple force/hauteur de chaise, ou une force verticale assistant le bassin facilite l'exploration au début de l'entrainement puis décroît progressivement a mesure que des chaises plus hautes sont introduites; un échantillonnage aléatoire de poses initiales et cibles générées par cinématique inverse sur plus de huit hauteurs de siège différentes; et une fonction de récompense inspirée de la biomécanique, qui guide le moment angulaire au décollement du siège et la transition du centre de pression pour un mouvement fluide et peu couteux en effort. Sur un évaluateur déterministe sans assistance de force, la politique atteint plus de 97% de réussite de mise en position debout équilibrée sur les huit hauteurs testées, y compris depuis des assises très enfoncées, un cas ou les approches antérieures échouaient plus fréquemment.

Ce résultat est significatif parce que le passage assis-debout reste un problème de contrôle particulièrement difficile: un humanoïde dispose d'une infinité de trajectoires possibles pour se lever en gardant l'équilibre, et les solutions existantes reposent généralement sur des démonstrations captées par motion capture ou des trajectoires codées a la main, ce qui limite leur adaptation a de nouvelles hauteurs de siège ou postures de départ. Montrer qu'une politique RL entraînée entièrement en simulation, sans données démonstratives, généralisé a huit hauteurs de chaise et surpasse l'état de l'art sur les postures profondément assises ouvre une piste pour réduire l'ingénierie manuelle requise a chaque nouveau scenario de mobilité. C'est un signal utile pour les équipes travaillant sur le contrôle bas niveau de robots humanoïdes destines a des environnements humains, ou se relever depuis des assises variées (canapé, chaise basse, sol) est une brique fonctionnelle courante mais rarement rendue robuste.

Ces résultats restent toutefois obtenus uniquement en simulation, sur un évaluateur déterministe sans le bruit ni les incertitudes d'un robot physique réel: aucun déploiement matériel n'est rapporte, et le transfert vers le monde réel n'est pas traite dans l'article. La démarche s'inscrit dans la lignée des travaux sur le curriculum learning applique au contrôle humanoïde par renforcement, une approche distincte des modèles généralistes de type vision-language-action, davantage orientes vers la manipulation et les taches de haut niveau que vers le contrôle fin de l'équilibre corporel. Aucune entreprise ni plateforme robotique commerciale n'est associée a ces travaux, qui relèvent de la recherche académique. Les auteurs ne mentionnent pas de suite prévue, comme un portage sur robot physique, laissant ouverte la question de la robustesse hors simulation.

Dans nos dossiers

À lire aussi

RoboNaldo : tirs précis, stables et puissants pour humanoïdes via apprentissage par renforcement à programme progressif guidé par le mouvement
1arXiv cs.RO 

RoboNaldo : tirs précis, stables et puissants pour humanoïdes via apprentissage par renforcement à programme progressif guidé par le mouvement

Des chercheurs d'OpenDriveLab ont publié le 13 juin 2026 RoboNaldo (arXiv:2606.11092), un framework d'apprentissage par renforcement en curriculum à trois étapes conçu pour entraîner un humanoïde à tirer au football avec précision et puissance. Déployé sur un Unitree G1 avec perception embarquée, le système atteint une erreur de tir moyenne de 0,73 m depuis 3 m en situation de coup franc (balle stationnaire), et 0,86 m sur balle en mouvement. La vitesse post-contact de la balle atteint 13,10 m/s, soit 59 à 71 % de la vitesse mesurée chez des joueurs professionnels en match ouvert. En simulation, RoboNaldo réduit l'erreur de tir de 48,6 % et multiplie la vélocité de frappe par 2,96 par rapport aux baselines de référence antérieures. L'intérêt technique réside dans la combinaison de deux approches qui s'avèrent complémentaires plutôt qu'opposées : le motion tracking-driven RL (stable mais rigide face à des positions de balle variables) et le task reward-driven RL (flexible mais inefficace à explorer des kicks valides de zéro). RoboNaldo hybride les deux via un curriculum progressif : le robot apprend d'abord un prior de coup de pied corps entier stable à partir d'une seule référence humaine, puis l'adapte à des positions de balle aléatoires, puis à une balle en mouvement via une interface locomotion-commande/kick-trigger. Un planificateur heuristique haut niveau pilote l'entraînement, mais le même policy bas niveau peut être conduit par n'importe quel contrôleur alternatif à l'inférence, ce qui est une propriété utile pour l'intégration dans des systèmes plus larges. Il reste que les résultats présentés s'appuient sur des vidéos et métriques de laboratoire contrôlé, sans terrain irrégulier ni adversaires dynamiques. OpenDriveLab, lab de recherche en autonomie embodied associé à Shanghai AI Lab, se positionne ici dans un espace de plus en plus disputé. Boston Dynamics, Agility Robotics (Figure, Tesla Optimus) concentrent leurs démonstrations sur la manipulation industrielle et la locomotion bipède en entrepôt, tandis que des travaux comme DribbleBot (CMU, 2023) ou les robots footballeurs de l'équipe NimbRo avaient déjà exploré le jeu avec ballon, mais sur des plateformes quadrupèdes ou plus légères. RoboNaldo est présenté comme une démonstration de recherche (preprint non peer-reviewed à ce stade) : aucun pilote industriel ni timeline de commercialisation n'est annoncé. La prochaine étape logique serait l'évaluation en conditions non structurées et l'intégration d'un contrôleur haut niveau appris plutôt qu'heuristique.

RecherchePaper
1 source
Apprentissage des mouvements de patinage à roulettes pour robots humanoïdes via des priorités de mouvement adverses
2arXiv cs.RO 

Apprentissage des mouvements de patinage à roulettes pour robots humanoïdes via des priorités de mouvement adverses

Des chercheurs présentent, dans un article déposé le 14 juillet 2026 sur arXiv (2607.10815), une méthode d'apprentissage par renforcement pour faire patiner un robot humanoïde en rollers. Le système s'appuie sur les Adversarial Motion Priors (AMP), une technique qui entraîne une politique de contrôle à imiter des mouvements de référence tout en respectant les contraintes physiques du robot. Deux allures distinctes sont visées : le Pump Glide (une godille d'impulsion) et le Push Glide (une poussée alternée classique du patinage). Pour chacune, les auteurs ont capturé des données de mouvement humain par motion capture, puis les ont retargetées, c'est-à-dire adaptées à la morphologie du robot humanoïde, avant de les lisser et de les rééchantillonner en états de référence exploitables pour l'entraînement AMP. Les deux allures sont apprises séparément, avec des jeux de données, des politiques et des architectures de récompense entièrement indépendants. Des expériences en simulation évaluent la qualité du geste, le suivi de vitesse, la capacité à tourner et l'apport de chaque composante de récompense via des ablations. L'enjeu dépasse l'anecdote du robot à roulettes : patiner impose de gérer simultanément l'équilibre corps entier, des contacts roulants à faible frottement et une posture qui varie avec la vitesse, un problème de contrôle nettement plus contraint que la marche ou la course déjà démontrées sur humanoïdes. Réussir ce type de locomotion en simulation valide la robustesse des pipelines AMP pour des dynamiques de contact inhabituelles, un signal utile pour les équipes qui explorent des locomotions non conventionnelles (patins, skis, roues) au-delà des gaits bipèdes standards. Cela reste toutefois un résultat de simulation, sans transfert annoncé vers un robot physique ni précision sur la plateforme matérielle visée. Les méthodes AMP, popularisées dans l'animation de personnages puis reprises en robotique pour générer des démarches naturelles et stables, connaissent depuis deux ans une adoption croissante dans le contrôle d'humanoïdes, portée par des laboratoires travaillant sur la locomotion bipède avancée. Cet article s'inscrit dans cette lignée en repoussant le champ d'application vers des gaits hybrides homme-machine inédits. Les auteurs ne mentionnent pas de calendrier de validation sur robot réel ni de partenaire industriel associé à ces travaux.

RecherchePaper
1 source
Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs
3arXiv cs.RO 

Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs

Une équipe de chercheurs a publié fin mai 2026 sur arXiv (arXiv:2605.18611) un framework d'apprentissage par renforcement unifié permettant à un seul contrôleur de faire marcher, courir et se relever après une chute le robot humanoïde Unitree G1, sans commande explicite de changement de mode au déploiement. L'approche étend les Adversarial Motion Priors (AMP) en remplaçant la distribution de référence globale par un mécanisme de routage conditionné à l'état : un seuil fixe sur la gravité projetée (|gz+1| > 0,6, soit environ 37° d'inclinaison du torse par rapport à la verticale) aiguille chaque transition d'entraînement soit vers un discriminateur dédié à la récupération, soit vers un discriminateur de locomotion conditionné par la vitesse commandée, qui couvre à la fois la marche et la course. Seuls trois clips de motion capture extraits du jeu de données LAFAN1 sont nécessaires pour régulariser l'ensemble du comportement. Sur hardware réel, la politique tourne à 50 Hz sous forme d'un fichier ONNX figé, sans aucune logique de mode à l'exécution, et valide des relevés réussis depuis les positions ventrale et dorsale ainsi que des transitions fluides marche-course. Ce résultat s'attaque directement à un problème d'intégration récurrent dans la robotique humanoïde commerciale : la fragmentation en contrôleurs spécialisés par mode, reliés par des automates à états qui génèrent des zones de transition fragiles et coûteuses à maintenir. Démontrer qu'une politique apprise par RL couvre ces régimes de façon continue sur hardware réel, et non uniquement en simulation, affaiblit l'argument du sim-to-real gap rédhibitoire pour les comportements complexes. Le coût d'annotation est lui aussi remarquablement bas : trois clips de reference suffisent là où d'autres travaux en exigent des dizaines, ce qui rend la méthode potentiellement transférable à d'autres plateformes avec un effort de données limité, qu'il s'agisse du PAL Robotics TALOS, du MIROKAÏ d'Enchanted Tools, ou de tout humanoïde léger à faible budget de motion capture. La publication s'inscrit dans une course dense à la locomotion humanoïde robuste, où Boston Dynamics (Atlas), Figure (Figure 03), Agility Robotics (Digit) et Tesla (Optimus Gen 3) investissent massivement, mais publient peu. Sur le plan académique, des approches concurrentes comme les VLA (Vision-Language-Action models) de Physical Intelligence ou les travaux de Berkeley visent des politiques encore plus générales, mais sacrifient souvent la robustesse physique au profit de la flexibilité sémantique. L'utilisation du Unitree G1, disponible à environ 16 000 dollars et largement répandu dans les laboratoires, confère à ces travaux une reproductibilité pratique supérieure aux publications sur plateformes fermées. L'article ne précise pas de timeline de déploiement industriel, mais la compatibilité ONNX et l'absence de logique embarquée à l'exécution réduisent la barrière à l'intégration pour un OEM ou un intégrateur souhaitant évaluer la méthode sur sa propre plateforme.

UELa méthode, compatible ONNX et nécessitant seulement 3 clips de motion capture, est explicitement identifiée comme transférable au MIROKAÏ d'Enchanted Tools (FR) et au TALOS de PAL Robotics (EU), réduisant le coût d'adaptation pour les équipes de recherche et les intégrateurs européens.

RecherchePaper
1 source
DPL : locomotion humanoïde perceptive par profondeur seule, via synthèse de profondeur réaliste et reconstruction du terrain par attention croisée
4arXiv cs.RO 

DPL : locomotion humanoïde perceptive par profondeur seule, via synthèse de profondeur réaliste et reconstruction du terrain par attention croisée

Une équipe de recherche en robotique publie sur arXiv (identifiant 2510.07152, version 3, une révision d'un article déjà soumis) un nouveau cadre baptisé DPL, pour Depth-only Perceptive Locomotion, destiné à la marche adaptative des robots humanoïdes sur terrain accidenté. Le constat de départ : la perception de terrain pour humanoïdes reste coincée entre deux approches limitées. L'apprentissage de bout en bout à partir d'images de profondeur souffre d'une efficacité d'entraînement faible et d'un écart important entre simulation et réel. Les méthodes fondées sur des cartes d'élévation, elles, exigent plusieurs capteurs visuels et un système de localisation, ce qui ajoute de la latence et fragilise la robustesse. DPL combine trois briques : une politique de marche guidée par une perception pré-entraînée à base de carte d'élévation mais fonctionnant avec un minimum d'entrée visuelle réelle (architecture dite "blind backbone"), un transformeur à attention croisée multimodale qui reconstruit une représentation structurée du terrain à partir d'images de profondeur bruitées, et une méthode de synthèse d'images de profondeur réalistes, combinant lancer de rayons sensible à l'auto-occlusion et modélisation du bruit, qui réduit de plus de 30 % l'erreur de reconstruction du terrain. Le tout a été validé sur un robot humanoïde grandeur nature, avec une locomotion agile sur des terrains variés et complexes. L'enjeu pratique est clair pour les intégrateurs et les fabricants de robots humanoïdes déployés en usine ou en environnement extérieur : les systèmes multi-capteurs avec cartographie d'élévation restent coûteux et sensibles aux dérives de localisation, tandis qu'une simple caméra de profondeur est bien moins chère mais historiquement peu fiable en conditions réelles. Si l'écart sim-to-real annoncé est effectivement comblé, cela ouvrirait la voie à des humanoïdes moins instrumentés, donc moins chers à produire et à maintenir, sans sacrifier la capacité à franchir marches, gravats ou sols irréguliers, un point critique pour toute la course actuelle à la commercialisation des humanoïdes. Le papier s'inscrit dans un champ de recherche académique actif où plusieurs laboratoires explorent des alternatives à la cartographie d'élévation classique pour réduire la dépendance au matériel. Comme pour beaucoup de publications arXiv de ce type, aucun partenaire industriel ni date de déploiement commercial n'est mentionné : il s'agit d'une preuve de concept en robot réel, sans indication de suite annoncée par les auteurs.

RecherchePaper
1 source