Aller au contenu principal
PAMoR : génération en temps réel de mouvements affectifs paramétrés pour robots humanoïdes
RecherchearXiv cs.RO 

PAMoR : génération en temps réel de mouvements affectifs paramétrés pour robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 28 août 2026 sur arXiv (2608.28213) un système baptisé PAMoR, qui génère des mouvements de robot humanoïde porteurs d'une émotion mesurable, plutôt qu'imitée depuis une vidéo de référence ou un simple mot-clé comme le font les systèmes existants pour avatars virtuels. Le système calcule en forme fermée une coordonnée de valence-arousal directement depuis la cinématique du robot, à partir de l'expansion posturale et de l'énergie du mouvement, sans aucune annotation humaine. Un modèle d'action et deux modèles affectifs, entraînés dans un espace latent partagé, se combinent à chaque étape de débruitage: le premier fixe la tâche exécutée, les seconds en modulent la tonalité émotionnelle. Le mouvement corps entier tourne en temps réel, en boucle autorégressive, sur un Unitree G1 à 29 degrés de liberté, action et émotion restant modifiables à la volée. Lors d'une étude perceptuelle, des évaluateurs humains ont identifié l'émotion commandée dans 38% des essais, contre 44% pour des mouvements joués par des acteurs humains.

Le secteur humanoïde communique surtout sur la manipulation et la locomotion; l'expressivité émotionnelle des robots reste le plus souvent démontrée par des vidéos sélectionnées plutôt que mesurée par un protocole contrôlé. PAMoR propose un paramètre affectif quantifiable et éditable en temps réel, exploitable dans une boucle de contrôle, ce qui intéresse les intégrateurs travaillant sur l'accueil, l'assistance ou l'interaction sociale, sans dégrader la fidélité texte-mouvement des modèles d'action pure. Le score de reconnaissance de 38%, inférieur au niveau humain mais validé par une comparaison perceptuelle explicite plutôt que par une démo triée, fournit une mesure rare et vérifiable de l'expressivité d'un humanoïde, un exercice auquel peu d'annonces du secteur se prêtent.

La génération de mouvement expressif existait déjà pour les avatars virtuels, où le style émotionnel provient d'un clip de référence ou d'un mot d'émotion, deux entrées jugées non quantifiables par les auteurs de PAMoR. Le travail transpose cette approche à la robotique physique via le Unitree G1, plateforme de recherche largement utilisée en académie: il s'agit d'une démonstration reproductible et non d'un produit commercial, issue d'une publication arXiv non encore évaluée par les pairs. Elle se distingue des efforts commerciaux centrés sur la manipulation et la locomotion, à l'image des modèles vision-langage-action Pi-0 ou GR00T N2, en ciblant spécifiquement l'affect social du mouvement. Aucun calendrier de transfert vers une plateforme commerciale ni partenariat industriel n'est mentionné à ce stade.

À lire aussi

RoboGesture : génération en temps réel de gestes de parole synchronisés sémantiquement pour l'interaction humanoïde
1arXiv cs.RO 

RoboGesture : génération en temps réel de gestes de parole synchronisés sémantiquement pour l'interaction humanoïde

RoboGesture, un framework de recherche destiné à permettre aux robots humanoïdes de générer des gestes synchronisés et sémantiquement cohérents en réponse à la parole humaine, a été décrit dans un article publié sur arXiv fin août 2026 (arXiv:2608.28693). Le système s'appuie sur un jeu de données dédié couvrant plus de 300 catégories de gestes, construit via un pipeline automatisé produisant des paires audio-mouvement spécifiques au robot et garanties sans collision. L'architecture combine un "Hierarchical Semantic-Acoustic Aligner", qui extrait des indices prosodiques et sémantiques à plusieurs échelles directement depuis les tokens audio bruts, et un générateur de mouvement en continu basé sur un transformer de diffusion avec conditional flow matching. Une technique nommée "Anti-Inertia CFG Masking" empêche le modèle de retomber dans des schémas de mouvement répétitifs en le forçant à puiser activement dans le signal audio, tandis qu'un filtre de sécurité basé sur du contrôle prédictif (MPC) assure une exécution en temps réel sans collision sur le matériel physique. Les expériences ont été menées sur un humanoïde Unitree G1, avec des résultats présentés comme plus sûrs, plus rythmiquement cohérents et plus pertinents sémantiquement que les méthodes de référence existantes. Ce travail cible un angle mort du secteur humanoïde, focalisé jusqu'ici surtout sur la locomotion et la manipulation d'objets : la gestuelle expressive et conversationnelle, pourtant déterminante pour l'acceptabilité d'un robot en interaction sociale (accueil, guidage, service client). Les auteurs pointent un problème technique précis, "l'éclipse modale", où les modèles génératifs ignorent le signal audio et se contentent de prolonger l'inertie cinématique du mouvement précédent, produisant des gestes désynchronisés de la parole. Le filtre MPC vise à combler l'écart classique entre simulation et réel sur un point sensible : un humanoïde qui gesticule près d'un humain sans garantie anticollision est difficilement déployable. Ces résultats restent néanmoins issus d'un cadre évalué sur une seule plateforme, sans déploiement commercial annoncé : une preuve de concept méthodologique, pas un produit prêt à l'emploi. RoboGesture s'inscrit dans la vague plus large des modèles vision-langage-action qui cherchent à doter les humanoïdes d'un comportement naturel, aux côtés d'initiatives comme GR00T N2 de Nvidia, Helix de Figure AI ou Pi-0 de Physical Intelligence, mais avec un focus rare sur la gestuelle sociale plutôt que la manipulation ou la locomotion. Le choix du Unitree G1, plateforme chinoise relativement accessible et très utilisée par les laboratoires de recherche, souligne la nature académique du projet plus qu'une orientation produit immédiate. L'article ne mentionne aucune date de mise en œuvre industrielle ni partenariat commercial ; les prochaines étapes évoquées par les chercheurs portent sur l'élargissement du jeu de données et la validation en interaction réelle prolongée avec des utilisateurs humains.

RecherchePaper
1 source
Téléopération en temps réel d'un robot humanoïde par capture de mouvement IMU avec validation sim-vers-réel
2arXiv cs.RO 

Téléopération en temps réel d'un robot humanoïde par capture de mouvement IMU avec validation sim-vers-réel

Une équipe de recherche a publié en mai 2026 un système complet de téléopération whole-body en temps réel pour robot humanoïde, décrit dans un préprint arXiv (2605.12347). Le système capture les mouvements d'un opérateur via une combinaison Virdyn à centrales inertielles (IMU full-body), puis les retransmet en continu sur un robot Unitree G1. Le pipeline de retargeting cinématique et de contrôle fonctionne sans tampon offline ni composant d'apprentissage automatique. La validation s'est déroulée en deux étapes : d'abord en simulation via le modèle MuJoCo du G1 (sim2sim), puis déployé sans aucune modification sur le robot physique (sim2real). Le répertoire de mouvements reproduits couvre la marche, la station debout, la position assise, les rotations, les courbettes et des gestes expressifs coordonnés de tout le corps. Le résultat le plus significatif est le transfert sim-to-real sans recalibration, un point d'échec classique où les paramètres calibrés en simulation s'effondrent face aux frictions réelles, aux latences de communication et aux erreurs de modèle. L'absence de composant d'apprentissage automatique rend le système déterministe et auditable, un argument concret pour les intégrateurs industriels ou les labos qui constituents des datasets de téléopération pour l'imitation learning. L'utilisation de matériel grand public (la combinaison Virdyn est commercialement disponible) plutôt qu'un système de mocap optique type Vicon abaisse significativement le ticket d'entrée pour construire des pipelines de collecte de démonstrations. La limitation est symétrique : sans apprentissage, l'adaptabilité à des morphologies très différentes reste contrainte par le retargeting cinématique. Le Unitree G1 est un humanoïde d'entrée de gamme commercialisé depuis 2024 autour de 16 000 dollars, ciblant explicitement la recherche et les démos industrielles. La téléopération whole-body est devenue un axe central de la course aux données pour les systèmes humanoïdes : Physical Intelligence (Pi-0), Figure et 1X s'appuient tous sur des démonstrations téléopérées pour entraîner leurs politiques. Sur l'approche IMU appliquée aux humanoïdes, des travaux similaires ont été publiés par des équipes chinoises sur le Booster T1 et l'Unitree H1. Ce préprint ne mentionne aucun déploiement industriel ni partenariat commercial, c'est une contribution académique de validation de concept, pas un produit expédié.

UELes laboratoires européens constituant des jeux de données de téléopération pour l'apprentissage par imitation (INRIA, CEA-List, LAAS-CNRS) peuvent adopter cette approche IMU sur matériel grand public pour abaisser significativement leur coût d'entrée.

RecherchePaper
1 source
Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs
3arXiv cs.RO 

Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs

Des chercheurs ont publié le 21 août 2026 sur arXiv (référence 2608.20087v1) AdaPT, un système de planification et de suivi de mouvement adaptatif qui apprend à des robots humanoïdes à servir et échanger au tennis avec un style proche de celui des joueurs professionnels, directement à partir de vidéos de retransmissions télévisées. L'architecture est hiérarchique : un planificateur génère la trajectoire cinématique stylisée, tandis qu'un module de suivi (tracker) l'exécute en interférant le moins possible avec le plan initial. Validée en simulation, l'approche a ensuite révélé un écart important entre simulation et réel sur le robot Unitree G1, la précision du suivi se dégradant à cause de la planification autorégressive et du bruit de perception ; pour corriger cela, les auteurs ont entraîné le tracker à suivre des vitesses d'exécution randomisées et conditionné le planificateur via un adaptateur de vitesse appris. Les politiques AdaPT ont ensuite été déployées sur le robot humanoïde grand format Dobot Atom (1,7 mètre), capable de servir en conditions réelles sans capture de mouvement, avec vidéos et code publiés sur le site du projet. Ce résultat illustre concrètement la possibilité de transférer un mouvement stylisé et physiquement exigeant, appris depuis de simples vidéos, vers un robot humanoïde grande taille opérant sans motion capture ni environnement contrôlé, un enjeu central pour l'industrie face au fossé habituel entre démonstrations et performance réelle. Il faut toutefois le lire comme un résultat de recherche académique et non comme un produit commercialisé : aucune annonce de volumes, de prix ni de partenariat industriel n'accompagne la publication, et les essais restent limités en nombre. La méthode elle-même dépasse le seul tennis, puisqu'elle traite un problème plus général, générer des mouvements stylistiques complexes sans sacrifier la performance de la tâche, pertinent pour toute application humanoïde exigeant dextérité et fluidité. Ce travail s'inscrit dans une vague récente de recherches sur des humanoïdes jouant à des sports de balle, un domaine où plusieurs laboratoires ont récemment montré des frappes ou services au tennis, badminton ou ping-pong, souvent via des architectures de type VLA ou du renforcement pur. AdaPT se distingue par la combinaison d'une imitation de style issue de vidéos de diffusion et d'une architecture planificateur/tracker pensée spécifiquement pour limiter la dégradation lors du transfert simulation-réel. Les tests ont porté sur deux plateformes, le Unitree G1, standard courant en recherche sur la locomotion, et le Dobot Atom, humanoïde grand format du fabricant chinois Dobot. Les auteurs n'annoncent aucun calendrier de pilote commercial, se limitant à publier code et vidéos et à souligner des enseignements algorithmiques et d'ingénierie pour de futurs systèmes humanoïdes sportifs.

RecherchePaper
1 source
GenTrack : alignement physique pour la génération de mouvement natif au robot et le suivi humanoïde en zéro-shot
4arXiv cs.RO 

GenTrack : alignement physique pour la génération de mouvement natif au robot et le suivi humanoïde en zéro-shot

Des chercheurs présentent GenTrack, un nouveau framework d'apprentissage conjoint pour générer et suivre des mouvements sur robots humanoïdes, détaillé dans un article publié le 1er août 2026 sur arXiv (2608.01410v1). Le système a été testé sur le robot Unitree G1, avec deux architectures de suivi de mouvement, ProtoMotions et SONIC. L'évaluation couvre trois jeux de données en zero-shot : les benchmarks publics AMASS et LAFAN, ainsi qu'un ensemble privé de 1 024 paires prompt-mouvement collectées hors distribution, censé refléter des conditions réelles variées. Le principe central de GenTrack consiste à faire alterner deux étapes en ligne : un alignement du générateur de mouvements ancré dans l'exécution réelle et calculé de façon relative par groupe, puis un entraînement du tracker sur les nouvelles références ainsi produites, le tout stabilisé par des mécanismes d'ancrage et de rejeu pour limiter la dérive du modèle. L'enjeu technique visé est connu des équipes qui travaillent sur le contrôle des humanoïdes : les générateurs de mouvement texte-vers-mouvement, entraînés sur des données de capture humaine ou retargetées, produisent des trajectoires plausibles cinématiquement mais souvent inexécutables physiquement par un robot réel. Les approches existantes traitent ce problème dans un seul sens, en figeant soit le corpus généré, soit le tracker récompensé. GenTrack propose une boucle fermée entre les deux composants. Selon les auteurs, cette co-évolution en ligne améliore à la fois l'exécutabilité robotique des mouvements générés et la couverture zero-shot du tracker, avec un gain particulièrement marqué sur les références hors distribution, c'est-à-dire les cas les plus proches d'un usage industriel réel plutôt que d'un benchmark contrôlé. Le travail s'inscrit dans la lignée des recherches sur les modèles de suivi de mouvement génériques pour humanoïdes, où l'extension de la couverture zero-shot dépendait jusqu'ici de corpus embarqués coûteux à agrandir. GenTrack propose une alternative sans collecte de données supplémentaire, en exploitant plutôt un post-entraînement conjoint génération-suivi. L'article ne mentionne pas de déploiement industriel ni de partenaire matériel au-delà du G1 de Unitree utilisé comme plateforme d'évaluation ; il s'agit à ce stade d'une contribution méthodologique plutôt que d'un produit commercialisé.

RecherchePaper
1 source