Aller au contenu principal
Synthèse naturelle du mouvement assis-debout pour humanoïdes via curriculum d'assistance guidée et récompenses par étapes
RecherchearXiv cs.RO 

Synthèse naturelle du mouvement assis-debout pour humanoïdes via curriculum d'assistance guidée et récompenses par étapes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie un article arXiv (arXiv:2608.20823, mis en ligne le 24 aout 2026) qui présente une méthode d'apprentissage par renforcement pour générer un mouvement naturel de passage assis-debout (sit-to-stand, STS) chez un humanoïde, sans aucune démonstration humaine ni trajectoire de référence. Une politique unique, entraînée par Proximal Policy Optimisation (PPO), combine trois mécanismes: un curriculum couple force/hauteur de chaise, ou une force verticale assistant le bassin facilite l'exploration au début de l'entrainement puis décroît progressivement a mesure que des chaises plus hautes sont introduites; un échantillonnage aléatoire de poses initiales et cibles générées par cinématique inverse sur plus de huit hauteurs de siège différentes; et une fonction de récompense inspirée de la biomécanique, qui guide le moment angulaire au décollement du siège et la transition du centre de pression pour un mouvement fluide et peu couteux en effort. Sur un évaluateur déterministe sans assistance de force, la politique atteint plus de 97% de réussite de mise en position debout équilibrée sur les huit hauteurs testées, y compris depuis des assises très enfoncées, un cas ou les approches antérieures échouaient plus fréquemment.

Ce résultat est significatif parce que le passage assis-debout reste un problème de contrôle particulièrement difficile: un humanoïde dispose d'une infinité de trajectoires possibles pour se lever en gardant l'équilibre, et les solutions existantes reposent généralement sur des démonstrations captées par motion capture ou des trajectoires codées a la main, ce qui limite leur adaptation a de nouvelles hauteurs de siège ou postures de départ. Montrer qu'une politique RL entraînée entièrement en simulation, sans données démonstratives, généralisé a huit hauteurs de chaise et surpasse l'état de l'art sur les postures profondément assises ouvre une piste pour réduire l'ingénierie manuelle requise a chaque nouveau scenario de mobilité. C'est un signal utile pour les équipes travaillant sur le contrôle bas niveau de robots humanoïdes destines a des environnements humains, ou se relever depuis des assises variées (canapé, chaise basse, sol) est une brique fonctionnelle courante mais rarement rendue robuste.

Ces résultats restent toutefois obtenus uniquement en simulation, sur un évaluateur déterministe sans le bruit ni les incertitudes d'un robot physique réel: aucun déploiement matériel n'est rapporte, et le transfert vers le monde réel n'est pas traite dans l'article. La démarche s'inscrit dans la lignée des travaux sur le curriculum learning applique au contrôle humanoïde par renforcement, une approche distincte des modèles généralistes de type vision-language-action, davantage orientes vers la manipulation et les taches de haut niveau que vers le contrôle fin de l'équilibre corporel. Aucune entreprise ni plateforme robotique commerciale n'est associée a ces travaux, qui relèvent de la recherche académique. Les auteurs ne mentionnent pas de suite prévue, comme un portage sur robot physique, laissant ouverte la question de la robustesse hors simulation.

Dans nos dossiers

À lire aussi

PRIMO : odométrie guidée par le suivi du mouvement humain pour robots humanoïdes
1arXiv cs.RO 

PRIMO : odométrie guidée par le suivi du mouvement humain pour robots humanoïdes

Agibot Spatial Intelligence a publié sur arXiv, sous la référence 2609.23610, une méthode d'odométrie pour robots humanoïdes baptisée PRIMO (Prior-Informed Odometry from Human-Motion Tracking), conçue pour s'attaquer à deux failles du transfert simulation-vers-réel : des données d'entraînement limitées à une seule politique de contrôle, et des écarts sim-to-real qui fragilisent les prédictions non contraintes. La méthode génère sa supervision en faisant suivre au robot, en simulation, des mouvements humains retargetés et variés, indépendamment de la politique de déploiement finale, puis s'appuie sur un estimateur intégrant des priors physiques et de symétrie ainsi qu'une voie de contexte capteur brut. Sous un protocole unifié sur robot réel, elle réduit l'erreur moyenne d'odométrie de 31,6 à 61,7% face à la meilleure base externe testée ; l'entraînement croisé entre deux révisions de politiques de locomotion abaisse l'erreur de 86,8 à 94,6% en simulation et de 69,2 à 81,7% sur des mouvements dynamiques réels. Le code source est publié sur GitHub sous Agibot-Spatial-Intelligence/PRIMO. L'odométrie proprioceptive, qui estime position et orientation d'un robot à partir de ses seuls capteurs internes sans caméra ni LiDAR, est une brique critique pour la marche autonome des humanoïdes en usine ou en entrepôt, là où le GPS est absent et la vision peut être occultée. Le problème ciblé est structurel : la plupart des modèles existants restent liés à la politique de locomotion ayant servi à générer leurs données d'entraînement, ce qui les fragilise à chaque mise à jour de contrôleur, un frein concret pour les intégrateurs qui doivent faire évoluer leurs flottes sans tout réentraîner. En découplant l'odométrie du contrôleur de déplacement, PRIMO suggère que la généralisation sim-to-real de l'estimation d'état, faiblesse reconnue du secteur, peut se traiter par des contraintes physiques structurantes plutôt que par un simple ajout de données, une piste distincte des efforts de généralisation menés sur les modèles de manipulation de type VLA. Agibot, fabricant chinois de robots humanoïdes également connu sous le nom Zhiyuan Robotics, publie ce travail via sa division Spatial Intelligence, dédiée aux briques de perception et d'estimation d'état plutôt qu'à la seule vente de plateformes matérielles. Le recours à des mouvements humains retargetés pour combler le manque de données robotiques réelles rejoint une tendance plus large du secteur, où des laboratoires travaillant sur des modèles VLA comme GR00T N2 de Nvidia ou Helix de Figure explorent des voies similaires pour étendre la diversité des données d'entraînement au-delà de la téléopération. À ce stade, PRIMO reste une contribution de recherche accompagnée de code source public, sans annonce de déploiement en production ni de partenariat industriel associé, et sa validation indépendante sur d'autres plateformes humanoïdes que celles d'Agibot reste à venir.

RechercheActu
1 source
T-GMP : des modèles de mouvement génératifs conditionnés par le terrain pour une locomotion humanoïde naturelle et polyvalente
2arXiv cs.RO 

T-GMP : des modèles de mouvement génératifs conditionnés par le terrain pour une locomotion humanoïde naturelle et polyvalente

Des chercheurs ont mis en ligne une version révisée sur arXiv (arXiv:2606.06944v2) d'un article présentant T-GMP (Terrain-conditioned Generative Motion Priors), un module destiné à améliorer la marche des robots humanoïdes sur des terrains variés. Contrairement aux méthodes classiques d'apprentissage par renforcement, qui s'appuient sur des priors de mouvement figés, T-GMP apprend une variété latente de mouvements conditionnée par le terrain à partir d'un petit nombre de démonstrations expert associant états du robot et type de sol. Ce module permet des transitions de style fluides entre modes de marche, ce qui autorise une politique de contrôle unique capable de s'adapter aux variations de terrain plutôt que de nécessiter des politiques séparées. T-GMP est intégré dans un pipeline d'apprentissage adversarial : un discriminateur module dynamiquement les contraintes de naturel du mouvement selon les caractéristiques locales du sol, guidant la génération vers des trajectoires à la fois variées et proches du mouvement humain. Les auteurs ajoutent une pénalité de pose du pied (Foothold Penalty) pour favoriser des appuis sûrs sur terrains difficiles. Les expériences montrent que T-GMP surpasse les méthodes de référence sur trois critères : naturel du mouvement, diversité des mouvements et taux de réussite de la traversée, tout en conservant une coordination physique cohérente du corps. L'enjeu soulevé est un compromis récurrent en locomotion humanoïde : les politiques entraînées par imitation adversariale produisent des mouvements naturels mais figés sur un style unique, alors que diversifier le comportement dégrade en général le réalisme du geste. En conditionnant explicitement les priors sur le terrain plutôt que sur un style fixe, T-GMP vise à lever ce compromis, une seule politique restant capable de traverser des sols hétérogènes sans changer de réseau ni perdre en naturel. Pour les équipes qui développent des humanoïdes destinés à sortir des sols plats d'usine ou de laboratoire, entrepôts, chantiers, extérieurs, cette robustesse du déplacement touche directement l'un des principaux freins actuels à la commercialisation des humanoïdes généralistes. L'approche s'inscrit dans la tendance à rapprocher imitation de mouvement et généralisation par renforcement, plutôt qu'à multiplier des contrôleurs spécialisés par type de terrain. T-GMP prolonge la lignée des méthodes d'apprentissage de mouvement adversarial (proches des Adversarial Motion Priors désormais courantes en recherche sur la locomotion humanoïde), en y ajoutant un conditionnement terrain absent des approches à style fixe. Le document est une version révisée (v2) d'un preprint, sans mention de partenaire industriel, de plateforme robotique nommée ni de déploiement sur matériel réel : les résultats rapportés relèvent donc de benchmarks en simulation face à des méthodes concurrentes, pas d'une validation sur robot physique en conditions réelles. Aucun calendrier de transfert vers du matériel ni d'intégration à une plateforme humanoïde commerciale n'est communiqué, ce qui situe T-GMP au stade de la recherche méthodologique plutôt que du produit prêt à déployer.

RecherchePaper
1 source
RoboNaldo : tirs précis, stables et puissants pour humanoïdes via apprentissage par renforcement à programme progressif guidé par le mouvement
3arXiv cs.RO 

RoboNaldo : tirs précis, stables et puissants pour humanoïdes via apprentissage par renforcement à programme progressif guidé par le mouvement

Des chercheurs d'OpenDriveLab ont publié le 13 juin 2026 RoboNaldo (arXiv:2606.11092), un framework d'apprentissage par renforcement en curriculum à trois étapes conçu pour entraîner un humanoïde à tirer au football avec précision et puissance. Déployé sur un Unitree G1 avec perception embarquée, le système atteint une erreur de tir moyenne de 0,73 m depuis 3 m en situation de coup franc (balle stationnaire), et 0,86 m sur balle en mouvement. La vitesse post-contact de la balle atteint 13,10 m/s, soit 59 à 71 % de la vitesse mesurée chez des joueurs professionnels en match ouvert. En simulation, RoboNaldo réduit l'erreur de tir de 48,6 % et multiplie la vélocité de frappe par 2,96 par rapport aux baselines de référence antérieures. L'intérêt technique réside dans la combinaison de deux approches qui s'avèrent complémentaires plutôt qu'opposées : le motion tracking-driven RL (stable mais rigide face à des positions de balle variables) et le task reward-driven RL (flexible mais inefficace à explorer des kicks valides de zéro). RoboNaldo hybride les deux via un curriculum progressif : le robot apprend d'abord un prior de coup de pied corps entier stable à partir d'une seule référence humaine, puis l'adapte à des positions de balle aléatoires, puis à une balle en mouvement via une interface locomotion-commande/kick-trigger. Un planificateur heuristique haut niveau pilote l'entraînement, mais le même policy bas niveau peut être conduit par n'importe quel contrôleur alternatif à l'inférence, ce qui est une propriété utile pour l'intégration dans des systèmes plus larges. Il reste que les résultats présentés s'appuient sur des vidéos et métriques de laboratoire contrôlé, sans terrain irrégulier ni adversaires dynamiques. OpenDriveLab, lab de recherche en autonomie embodied associé à Shanghai AI Lab, se positionne ici dans un espace de plus en plus disputé. Boston Dynamics, Agility Robotics (Figure, Tesla Optimus) concentrent leurs démonstrations sur la manipulation industrielle et la locomotion bipède en entrepôt, tandis que des travaux comme DribbleBot (CMU, 2023) ou les robots footballeurs de l'équipe NimbRo avaient déjà exploré le jeu avec ballon, mais sur des plateformes quadrupèdes ou plus légères. RoboNaldo est présenté comme une démonstration de recherche (preprint non peer-reviewed à ce stade) : aucun pilote industriel ni timeline de commercialisation n'est annoncé. La prochaine étape logique serait l'évaluation en conditions non structurées et l'intégration d'un contrôleur haut niveau appris plutôt qu'heuristique.

RecherchePaper
1 source
BRACE : adapter les références corporelles pour un suivi de mouvement humanoïde sensible aux forces et au terrain
4arXiv cs.RO 

BRACE : adapter les références corporelles pour un suivi de mouvement humanoïde sensible aux forces et au terrain

Des chercheurs présentent BRACE, un contrôleur de suivi de mouvement du corps entier testé sur le Unitree G1 (humanoïde) en simulation et sur robot réel. Il est décrit dans un preprint arXiv (2610.07052v1) et vise un défaut des trackers actuels. Les trajectoires de référence qu'ils consomment sont enregistrées sur sol plat et sans charge, si bien que le contrôleur ignore à la fois les forces à échanger avec les objets et la pente du terrain. BRACE permet au robot d'exercer ou de compenser une force de main commandée depuis des poses variées, tout en suivant une référence plate sur terrain incliné. Le système repose sur deux enseignants spécialisés, l'un pour l'exertion de force, l'autre pour sa compensation. Ils sont distillés par DAgger dans un unique modèle élève de type flow-matching. Ce modèle fonctionne sur la seule proprioception, sans carte de hauteur ni mesure de torseur d'effort. Les auteurs n'indiquent ni charge maximale ni amplitude de pente dans le résumé. L'intérêt tient à la manière de répartir le problème. Les contrôleurs existants n'en traitent qu'un côté. Les politiques capables de force commandent un effort à l'effecteur sans prescrire de pose du corps entier. Les trackers adaptatifs au terrain traitent la charge comme une perturbation à rejeter, non comme un effort à commander. BRACE intègre la charge et la pente dans la référence elle-même, au lieu de laisser le tracker les absorber. Pour la téléopération, c'est un gain pratique. Un opérateur, même distant, fournit une trajectoire conçue pour le sol plat, et le robot résout pente et charge à bord. Cela réduit la dépendance à des capteurs coûteux ou fragiles, et ouvre la voie à des tâches de manipulation avec contact, comme pousser, tirer ou porter, sur sol irrégulier. Les résultats restent cependant ceux d'un preprint académique sur une seule plateforme. Aucun déploiement industriel n'est évoqué, et les performances chiffrées sont à vérifier dans l'article complet. Techniquement, deux mécanismes modifient la référence. La conformité au terrain relève les points d'appui et la racine du robot sur la surface locale. Une transformation de torseur calcule le déplacement de main qui produit la force voulue, avec les décalages induits du centre de masse et du centre de pression. Les limites d'effort des bras, propres à chaque enseignant, bornent cette transformation. Le travail s'inscrit dans la lignée des trackers de mouvement humanoïdes, de plus en plus utilisés comme interface de téléopération et de collecte de données, et il utilise le G1 d'Unitree, plateforme de recherche répandue. La suite logique serait une validation sur des tâches plus longues, des charges plus lourdes et d'autres morphologies.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source