
Stand-up humanoïde guidé par démonstration sur une surface déformable simulée
Une équipe de recherche publie sur arXiv (référence 2608.20852v1) une méthode d'apprentissage par renforcement guidée par démonstration pour générer un mouvement de relevage chez un robot humanoïde Unitree G1 à 29 degrés de liberté, sur un sol mou et déformable simulé. Le système part d'une démonstration humaine enregistrée sur sol dur, puis reproduit le comportement dans le simulateur physique MuJoCo, en modélisant la compliance du terrain via les paramètres solref et solimp de son modèle de contact souple pour corps rigides. La fonction de récompense combine le suivi de la trajectoire de référence, via un contrôle résiduel des positions articulaires, et des objectifs de récupération explicites: hauteur du bassin, verticalité du torse et posture finale. L'entraînement se déroule en deux temps, d'abord sur sol dur, puis avec une raideur de terrain abaissée et une zone de pénétration de surface élargie, forçant la politique à composer avec le retard de génération de la force de soutien pendant les phases de contact intense, tout en conservant le patron du geste démontré. En simulation, la politique apprise réussit la tâche de relevage sur deux séquences distinctes, atteint la hauteur de bassin et la verticalité ciblées, avec une pénétration de contact maximale d'environ 40 mm, et fonctionne aussi bien sur sol dur que sur sol mou.
Ce travail reste à ce stade purement académique et simulé, sans test sur robot physique mentionné, mais il touche un point souvent négligé dans les démonstrations spectaculaires de relevage: la plupart des vidéos publiées par les fabricants d'humanoïdes se déroulent sur sols rigides et plats de laboratoire, alors qu'un déploiement réel implique tapis, herbe, gravats ou terrains meubles où la réponse du sol au contact est retardée et non linéaire. L'étude d'ablation, qui montre que le seul suivi de trajectoire échoue et que des récompenses de récupération explicites sont indispensables, offre un enseignement méthodologique concret pour quiconque conçoit des politiques de relevage ou de récupération de chute par RL.
Le G1 d'Unitree, plateforme accessible largement adoptée par les laboratoires de recherche en locomotion, sert ici de support d'expérimentation plutôt que de produit destiné à un déploiement commercial, à la différence d'humanoïdes comme Optimus ou Figure 03 positionnés sur des cas d'usage industriels. MuJoCo, moteur physique standard pour la recherche en RL appliqué à la robotique, permet de tester des variations de terrain difficiles à reproduire de façon contrôlée sur du matériel réel. L'article ne mentionne aucun pilote industriel ni calendrier de transfert vers le réel: il s'agit d'un préprint posant les bases d'un futur passage sim-to-real, dans un domaine où Unitree et Boston Dynamics ont déjà médiatisé des capacités de relevage autonome sur sol dur.
Dans nos dossiers




