Aller au contenu principal
Stand-up humanoïde guidé par démonstration sur une surface déformable simulée
RecherchearXiv cs.RO 

Stand-up humanoïde guidé par démonstration sur une surface déformable simulée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (référence 2608.20852v1) une méthode d'apprentissage par renforcement guidée par démonstration pour générer un mouvement de relevage chez un robot humanoïde Unitree G1 à 29 degrés de liberté, sur un sol mou et déformable simulé. Le système part d'une démonstration humaine enregistrée sur sol dur, puis reproduit le comportement dans le simulateur physique MuJoCo, en modélisant la compliance du terrain via les paramètres solref et solimp de son modèle de contact souple pour corps rigides. La fonction de récompense combine le suivi de la trajectoire de référence, via un contrôle résiduel des positions articulaires, et des objectifs de récupération explicites: hauteur du bassin, verticalité du torse et posture finale. L'entraînement se déroule en deux temps, d'abord sur sol dur, puis avec une raideur de terrain abaissée et une zone de pénétration de surface élargie, forçant la politique à composer avec le retard de génération de la force de soutien pendant les phases de contact intense, tout en conservant le patron du geste démontré. En simulation, la politique apprise réussit la tâche de relevage sur deux séquences distinctes, atteint la hauteur de bassin et la verticalité ciblées, avec une pénétration de contact maximale d'environ 40 mm, et fonctionne aussi bien sur sol dur que sur sol mou.

Ce travail reste à ce stade purement académique et simulé, sans test sur robot physique mentionné, mais il touche un point souvent négligé dans les démonstrations spectaculaires de relevage: la plupart des vidéos publiées par les fabricants d'humanoïdes se déroulent sur sols rigides et plats de laboratoire, alors qu'un déploiement réel implique tapis, herbe, gravats ou terrains meubles où la réponse du sol au contact est retardée et non linéaire. L'étude d'ablation, qui montre que le seul suivi de trajectoire échoue et que des récompenses de récupération explicites sont indispensables, offre un enseignement méthodologique concret pour quiconque conçoit des politiques de relevage ou de récupération de chute par RL.

Le G1 d'Unitree, plateforme accessible largement adoptée par les laboratoires de recherche en locomotion, sert ici de support d'expérimentation plutôt que de produit destiné à un déploiement commercial, à la différence d'humanoïdes comme Optimus ou Figure 03 positionnés sur des cas d'usage industriels. MuJoCo, moteur physique standard pour la recherche en RL appliqué à la robotique, permet de tester des variations de terrain difficiles à reproduire de façon contrôlée sur du matériel réel. L'article ne mentionne aucun pilote industriel ni calendrier de transfert vers le réel: il s'agit d'un préprint posant les bases d'un futur passage sim-to-real, dans un domaine où Unitree et Boston Dynamics ont déjà médiatisé des capacités de relevage autonome sur sol dur.

À lire aussi

Robot semi-humanoïde NICO imite des gestes du bras par démonstration
1arXiv cs.RO 

Robot semi-humanoïde NICO imite des gestes du bras par démonstration

Le robot semi-humanoïde NICO peut désormais imiter des gestes du bras humain à partir d'une simple caméra RGB monoculaire, selon un article publié sur arXiv (2607.18197). Le système combine géométrie analytique et le modèle pré-entraîné MediaPipe pour l'estimation de pose. Pour chaque image vidéo, MediaPipe extrait les coordonnées 3D des points clés du corps humain pertinents (articulations du bras, poignets, mains). Ces coordonnées sont ensuite converties en angles articulaires via des relations géométriques dérivées mathématiquement, puis transposées vers la configuration moteur de NICO pour exécuter une séquence de mouvement prédéfinie. Les chercheurs ont testé la méthode sur plusieurs gestes du bras représentatifs avec six participants de tailles différentes, afin de vérifier la robustesse du système face à la morphologie variable des utilisateurs. Ce travail s'inscrit dans un enjeu central de l'interaction homme-robot (HRI) : la capacité d'un robot à reproduire des gestes humains de façon fluide et naturelle, un prérequis pour des usages comme l'apprentissage par démonstration, l'assistance sociale ou la collaboration physique. L'intérêt de l'approche tient à sa simplicité matérielle: pas de capteurs de mouvement, pas de caméra de profondeur, une seule caméra RGB suffit grâce à MediaPipe. C'est un signal utile pour les intégrateurs cherchant des solutions d'imitation gestuelle à faible coût, sans dépendre de capteurs spécialisés coûteux. Les auteurs restent toutefois transparents sur les limites: les gestes complexes et les mouvements du poignet posent problème, ce qui rappelle que l'imitation gestuelle générique et robuste reste un défi ouvert, loin d'être résolu par cette seule démonstration préliminaire. NICO est une plateforme robotique semi-humanoïde de taille enfant, utilisée en recherche pour explorer le développement cognitif et l'interaction sociale robot-humain. L'utilisation de MediaPipe, framework open source de Google pour l'estimation de pose en temps réel, s'inscrit dans une tendance plus large de recherche en robotique consistant à réutiliser des modèles de vision par ordinateur grand public plutôt qu'à développer des systèmes de perception propriétaires coûteux. Les auteurs présentent ce travail comme une étude préliminaire; les prochaines étapes attendues concerneraient l'amélioration de la précision sur les poses complexes et les mouvements fins du poignet, ainsi qu'une possible extension à l'imitation bimanuelle ou à des interactions plus dynamiques.

RecherchePaper
1 source
EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive
2arXiv cs.RO 

EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive

Un article de recherche publié sur arXiv sous la référence 2609.14432 (septembre 2026) présente EMoG, un framework de génération de démarche modulée par l'émotion pour la locomotion expressive de robots humanoïdes, construit autour d'un « code de style émotionnel » dont l'intensité est ajustable en continu. Combiné à des commandes physiques classiques (vitesse, direction), ce code alimente un réseau MLP léger qui génère en temps réel des trajectoires de démarche périodiques, expressives et cohérentes avec la commande demandée, ensuite exécutées par une politique unique d'apprentissage par renforcement. Pour l'entraînement, les auteurs ont constitué un jeu de données de démarches annotées par émotion auprès de performeurs professionnels, avec un pipeline automatisé extrayant des cycles de marche périodiques physiquement cohérents. EMoG intègre également un parseur basé sur un LLM convertissant des instructions en langage naturel libre en paramètres de style émotionnel et de mouvement, pour un contrôle interactif. Les expériences rapportées montrent une modulation continue du style de marche avec des signaux expressifs perceptibles, sans dégradation du suivi des commandes physiques. La plupart des systèmes de locomotion humanoïde se concentrent sur la stabilité et l'exécution de tâches, laissant l'expressivité émotionnelle de côté ou reléguée aux gestes du haut du corps plutôt qu'intégrée au contrôle de la marche lui même. En traitant l'émotion comme un paramètre continu du contrôleur de bas niveau plutôt que comme une couche cosmétique ajoutée après coup, EMoG ouvre la voie à des robots capables de signaler un état (prudent, enjoué, fatigué) par leur simple façon de marcher, sans sacrifier la précision de navigation attendue par les intégrateurs. C'est aussi un signal de plus que les interfaces en langage naturel pilotées par LLM s'imposent comme couche de contrôle au dessus des politiques d'apprentissage par renforcement de bas niveau, une tendance déjà visible dans les architectures vision langage action du secteur. Ce travail s'inscrit dans un champ encore jeune : la quasi totalité des efforts commerciaux sur les humanoïdes, stabilité de marche, manipulation, téléopération, ignore largement la dimension expressive, jugée secondaire face aux enjeux de fiabilité et de rentabilité industrielle. EMoG reste à ce stade un travail académique publié en preprint, sans plateforme robotique ni partenaire industriel nommés dans le résumé, et sans annonce de déploiement réel : les résultats proviennent d'expériences contrôlées, pas d'un déploiement en usine ou en environnement public. Il rejoint néanmoins un intérêt croissant pour l'expressivité robotique comme levier d'acceptabilité sociale, un axe que laboratoires et startups d'interaction humain robot devraient suivre de près pour des usages d'accueil, de service ou de robotique sociale, où la perception émotionnelle du geste compte autant que la performance motrice.

RecherchePaper
1 source
La fluidité comme contrainte pour une locomotion humanoïde stable
3arXiv cs.RO 

La fluidité comme contrainte pour une locomotion humanoïde stable

Un article de recherche publié sur arXiv (2609.24552) présente DeCap, un algorithme d'apprentissage par renforcement sous contraintes pour le contrôle corps entier des robots humanoïdes. Le constat de départ : le bas du corps doit rester réactif pour l'équilibre, tandis que le haut du corps doit être fortement régulé pour la stabilité, une distinction que les méthodes RL classiques ignorent en imposant la fluidité via des récompenses auxiliaires uniformes, qui entrent en concurrence avec les objectifs de tâche. DeCap découple les contraintes en deux groupes, haut et bas du corps, formulées comme des limites physiques explicites de vitesse et d'accélération, complétées par une pénalité barrière qui s'active dès l'approche de ces limites sans diverger. Sur une tâche réelle de contrôle corps entier, il réduit le taux de variation des actions du haut du corps d'un facteur 2,50 et l'accélération d'un facteur 2,18 par rapport aux politiques basées récompense, tout en améliorant aussi la fluidité du bas du corps. Ce résultat s'attaque à un compromis concret pour l'industrie : un haut du corps trop rigide limite la dextérité utile, un haut du corps mal amorti compromet l'équilibre et use l'actionnement, un frein réel au déploiement en usine ou en entrepôt où sécurité et répétabilité priment. Le tuning manuel des récompenses selon le terrain ou la tâche est un goulot d'étranglement connu du RL appliqué à la locomotion humanoïde ; qu'un même jeu de contraintes se transfère sans retuning à des terrains variés, si confirmé au-delà des conditions testées, réduirait le coût d'ingénierie pour les intégrateurs. L'approche questionne aussi la pratique dominante du reward shaping en RL, en montrant qu'une contrainte physique explicite offre un contrôle plus direct et prévisible que des pénalités négociées. Le travail s'inscrit dans le champ du RL sous contraintes, une alternative au RL par récompense pure qui gagne du terrain à mesure que les humanoïdes passent des démonstrations en laboratoire à des essais en conditions réelles, où la marge d'erreur mécanique est faible. Il agit à un niveau différent de celui des modèles vision-langage-action qui pilotent la planification haut niveau des humanoïdes : DeCap se concentre sur la couche bas niveau de génération de mouvement. Classé comme nouvelle publication sur arXiv, l'article ne précise ni le robot ni le laboratoire à l'origine des essais réels et n'annonce aucun calendrier de déploiement : il s'agit à ce stade d'une contribution de recherche méthodologique, validée expérimentalement mais non commercialisée.

RecherchePaper
1 source
EmoPose : génération de gestes sensibles aux émotions guidée par un modèle vision-langage pour robots humanoïdes
4arXiv cs.RO 

EmoPose : génération de gestes sensibles aux émotions guidée par un modèle vision-langage pour robots humanoïdes

Un article publié sur arXiv (2609.23414v1) présente EmoPose, un système associant un modèle vision-langage (VLM) et un contrôleur robotique déterministe pour générer des gestes porteurs d'émotion chez les robots humanoïdes : à partir d'un texte, d'un historique de dialogue et d'un contexte visuel optionnel, le VLM choisit un plan de gestes ordonné (classe communicative, variante, intensité, point d'ancrage vocal), puisé dans une bibliothèque de mouvements propre au robot qui fournit des cibles articulaires à 14 degrés de liberté (DoF). L'outil Pose Studio génère automatiquement les trajectoires, les prévisualise sous le simulateur MuJoCo et synchronise les nouvelles entrées avec le guide du VLM, tandis que des modules déterministes côté robot valident les plans, construisent les trajectoires et gèrent l'ordonnancement, la mise en file et l'interruption des gestes. Sur le banc d'essai EmoPose-Bench, une planification structurée avec GPT-5.5 atteint 98,25 % (± 0,52) sur le niveau facile et 76,50 % (± 0,54) au global, un score supérieur à un prompting à étiquette directe avec le même modèle. Le système exécute la suite nominale sous MuJoCo et reproduit les 29 variantes de la bibliothèque sur un robot Unitree G1 physique, démontré lors d'une visite de laboratoire en quatre étapes mêlant narration expressive avec interruption, dialogue ancré sur la caméra et navigation. Cette architecture répond à un problème concret pour les intégrateurs : confier le contrôle articulaire brut à un modèle de fondation reste imprévisible, tandis qu'un robot purement scripté manque de flexibilité sociale. En cantonnant le VLM à un rôle de sélection sémantique dans une bibliothèque de mouvements pré-validée et en laissant le contrôle bas niveau à des modules déterministes, EmoPose permet d'étendre le répertoire expressif à de nouveaux contextes sociaux sans modifier l'interface de contrôle ni recertifier la sécurité du mouvement. C'est un argument dans le débat sur le passage à l'échelle des modèles vision-langage-action (VLA) : plutôt que de démontrer qu'un VLA génère directement des trajectoires fiables de bout en bout, les auteurs montrent qu'un VLM peut piloter une bibliothèque de gestes pré-validés, approche plus proche de ce qu'un intégrateur industriel peut auditer et déployer en sécurité. Les chiffres de précision restent néanmoins issus d'un benchmark maison et d'une démonstration en laboratoire contrôlé, pas d'un déploiement en conditions réelles à grande échelle. EmoPose s'inscrit dans la vague de travaux cherchant à combler l'écart entre les modèles vision-langage-action généralistes, tels Pi-0 ou GR00T N2, et le besoin d'un contrôle fiable et spécifique à chaque corps physique ; contrairement à ces approches de génération de mouvement de bout en bout, EmoPose sépare explicitement raisonnement social et exécution motrice. Le choix du Unitree G1, plateforme humanoïde largement utilisée par les laboratoires de recherche pour son coût accessible, souligne la nature académique de la démonstration plutôt qu'un déploiement commercial. Les auteurs ne mentionnent ni partenaire industriel ni calendrier de commercialisation : à ce stade, la publication reste une validation de méthode sur banc d'essai et lors d'une visite de laboratoire, sans pilote client ni déploiement annoncé en environnement réel.

RecherchePaper
1 source