Aller au contenu principal
RecherchearXiv cs.RO 

ECHO-G : génération de mouvements de robot humanoïde incarné synchronisés à la parole

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv ECHO-G, un cadre de génération de mouvements corporels complets synchronisés à la parole pour robots humanoïdes. Le système repose sur un Speech-Grounded Diffusion Transformer (SGDiT), conditionné à la fois par l'audio de la parole et par des transcriptions horodatées. Il associe des caractéristiques acoustiques alignées image par image à un contexte linguistique au niveau du token, en préservant leurs granularités distinctes. L'entraînement utilise le rectified flow matching, et le modèle apprend les relations un-à-plusieurs entre un énoncé et les mouvements possibles, directement dans l'espace du robot (articulations du humanoïde) plutôt que dans celui du corps humain. Les auteurs introduisent aussi un jeu de données audio-texte-robot dérivé de BEAT2, ainsi qu'un benchmark couvrant trois axes : les caractéristiques de la gestuelle co-verbale, la qualité du mouvement robotique et l'efficacité à l'exécution. Une démonstration sur un humanoïde physique est présentée. Le code d'entraînement, d'inférence et d'évaluation, ainsi que les données, sont publiés via la page du projet. L'article ne précise ni le robot utilisé, ni le nombre de degrés de liberté, ni les temps d'inférence chiffrés dans son résumé.

L'intérêt tient à la méthode. Jusqu'ici, la gestuelle des robots parlants passe souvent par un pipeline en deux temps : un modèle génère un mouvement humain (squelette ou corps paramétrique SMPL), puis un retargeting l'adapte à la cinématique du robot. Cette étape introduit des pertes : limites articulaires, contraintes d'équilibre, différences de proportions. Selon les auteurs, la génération directe en espace robot l'emporte sur les pipelines de génération humaine plus retargeting évalués. Ce résultat vaut pour les baselines testées, pas pour l'ensemble de l'état de l'art. L'ablation montre aussi que combiner audio (prosodie, rythme) et texte (contenu sémantique) améliore les résultats par rapport à chaque modalité seule, ce qui plaide pour des gestes à la fois bien rythmés et pertinents. Pour les intégrateurs de robots d'accueil, de service ou de démonstration, cela ouvre la voie à une expressivité moins scriptée. Les limites sont claires : la validation matérielle semble se limiter à une démonstration, l'évaluation subjective repose sur une étude de notation vidéo, et aucune donnée de déploiement réel n'est fournie.

ECHO-G s'inscrit dans la lignée des travaux de génération de gestes co-verbaux sur le jeu de données BEAT et sa version BEAT2, conçus pour des avatars humains et non pour des robots. Le passage à l'espace robot rejoint une tendance plus large, celle des modèles génératifs entraînés directement sur l'embodiment cible, déjà visible dans les politiques VLA et les approches par flow matching. Le jeu de données dérivé et le benchmark pourraient servir de référence commune, à condition que d'autres équipes les adoptent et les testent sur des morphologies différentes. Les prochaines étapes à surveiller sont la généralisation à d'autres humanoïdes, la mesure de la latence en conditions réelles et l'intégration avec des systèmes de dialogue en temps réel.

Dans nos dossiers

À lire aussi

RoboGesture : génération en temps réel de gestes de parole synchronisés sémantiquement pour l'interaction humanoïde
1arXiv cs.RO 

RoboGesture : génération en temps réel de gestes de parole synchronisés sémantiquement pour l'interaction humanoïde

RoboGesture, un framework de recherche destiné à permettre aux robots humanoïdes de générer des gestes synchronisés et sémantiquement cohérents en réponse à la parole humaine, a été décrit dans un article publié sur arXiv fin août 2026 (arXiv:2608.28693). Le système s'appuie sur un jeu de données dédié couvrant plus de 300 catégories de gestes, construit via un pipeline automatisé produisant des paires audio-mouvement spécifiques au robot et garanties sans collision. L'architecture combine un "Hierarchical Semantic-Acoustic Aligner", qui extrait des indices prosodiques et sémantiques à plusieurs échelles directement depuis les tokens audio bruts, et un générateur de mouvement en continu basé sur un transformer de diffusion avec conditional flow matching. Une technique nommée "Anti-Inertia CFG Masking" empêche le modèle de retomber dans des schémas de mouvement répétitifs en le forçant à puiser activement dans le signal audio, tandis qu'un filtre de sécurité basé sur du contrôle prédictif (MPC) assure une exécution en temps réel sans collision sur le matériel physique. Les expériences ont été menées sur un humanoïde Unitree G1, avec des résultats présentés comme plus sûrs, plus rythmiquement cohérents et plus pertinents sémantiquement que les méthodes de référence existantes. Ce travail cible un angle mort du secteur humanoïde, focalisé jusqu'ici surtout sur la locomotion et la manipulation d'objets : la gestuelle expressive et conversationnelle, pourtant déterminante pour l'acceptabilité d'un robot en interaction sociale (accueil, guidage, service client). Les auteurs pointent un problème technique précis, "l'éclipse modale", où les modèles génératifs ignorent le signal audio et se contentent de prolonger l'inertie cinématique du mouvement précédent, produisant des gestes désynchronisés de la parole. Le filtre MPC vise à combler l'écart classique entre simulation et réel sur un point sensible : un humanoïde qui gesticule près d'un humain sans garantie anticollision est difficilement déployable. Ces résultats restent néanmoins issus d'un cadre évalué sur une seule plateforme, sans déploiement commercial annoncé : une preuve de concept méthodologique, pas un produit prêt à l'emploi. RoboGesture s'inscrit dans la vague plus large des modèles vision-langage-action qui cherchent à doter les humanoïdes d'un comportement naturel, aux côtés d'initiatives comme GR00T N2 de Nvidia, Helix de Figure AI ou Pi-0 de Physical Intelligence, mais avec un focus rare sur la gestuelle sociale plutôt que la manipulation ou la locomotion. Le choix du Unitree G1, plateforme chinoise relativement accessible et très utilisée par les laboratoires de recherche, souligne la nature académique du projet plus qu'une orientation produit immédiate. L'article ne mentionne aucune date de mise en œuvre industrielle ni partenariat commercial ; les prochaines étapes évoquées par les chercheurs portent sur l'élargissement du jeu de données et la validation en interaction réelle prolongée avec des utilisateurs humains.

RecherchePaper
1 source
PAMoR : génération en temps réel de mouvements affectifs paramétrés pour robots humanoïdes
2arXiv cs.RO 

PAMoR : génération en temps réel de mouvements affectifs paramétrés pour robots humanoïdes

Des chercheurs ont publié le 28 août 2026 sur arXiv (2608.28213) un système baptisé PAMoR, qui génère des mouvements de robot humanoïde porteurs d'une émotion mesurable, plutôt qu'imitée depuis une vidéo de référence ou un simple mot-clé comme le font les systèmes existants pour avatars virtuels. Le système calcule en forme fermée une coordonnée de valence-arousal directement depuis la cinématique du robot, à partir de l'expansion posturale et de l'énergie du mouvement, sans aucune annotation humaine. Un modèle d'action et deux modèles affectifs, entraînés dans un espace latent partagé, se combinent à chaque étape de débruitage: le premier fixe la tâche exécutée, les seconds en modulent la tonalité émotionnelle. Le mouvement corps entier tourne en temps réel, en boucle autorégressive, sur un Unitree G1 à 29 degrés de liberté, action et émotion restant modifiables à la volée. Lors d'une étude perceptuelle, des évaluateurs humains ont identifié l'émotion commandée dans 38% des essais, contre 44% pour des mouvements joués par des acteurs humains. Le secteur humanoïde communique surtout sur la manipulation et la locomotion; l'expressivité émotionnelle des robots reste le plus souvent démontrée par des vidéos sélectionnées plutôt que mesurée par un protocole contrôlé. PAMoR propose un paramètre affectif quantifiable et éditable en temps réel, exploitable dans une boucle de contrôle, ce qui intéresse les intégrateurs travaillant sur l'accueil, l'assistance ou l'interaction sociale, sans dégrader la fidélité texte-mouvement des modèles d'action pure. Le score de reconnaissance de 38%, inférieur au niveau humain mais validé par une comparaison perceptuelle explicite plutôt que par une démo triée, fournit une mesure rare et vérifiable de l'expressivité d'un humanoïde, un exercice auquel peu d'annonces du secteur se prêtent. La génération de mouvement expressif existait déjà pour les avatars virtuels, où le style émotionnel provient d'un clip de référence ou d'un mot d'émotion, deux entrées jugées non quantifiables par les auteurs de PAMoR. Le travail transpose cette approche à la robotique physique via le Unitree G1, plateforme de recherche largement utilisée en académie: il s'agit d'une démonstration reproductible et non d'un produit commercial, issue d'une publication arXiv non encore évaluée par les pairs. Elle se distingue des efforts commerciaux centrés sur la manipulation et la locomotion, à l'image des modèles vision-langage-action Pi-0 ou GR00T N2, en ciblant spécifiquement l'affect social du mouvement. Aucun calendrier de transfert vers une plateforme commerciale ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
GenTrack : alignement physique pour la génération de mouvement natif au robot et le suivi humanoïde en zéro-shot
3arXiv cs.RO 

GenTrack : alignement physique pour la génération de mouvement natif au robot et le suivi humanoïde en zéro-shot

Des chercheurs présentent GenTrack, un nouveau framework d'apprentissage conjoint pour générer et suivre des mouvements sur robots humanoïdes, détaillé dans un article publié le 1er août 2026 sur arXiv (2608.01410v1). Le système a été testé sur le robot Unitree G1, avec deux architectures de suivi de mouvement, ProtoMotions et SONIC. L'évaluation couvre trois jeux de données en zero-shot : les benchmarks publics AMASS et LAFAN, ainsi qu'un ensemble privé de 1 024 paires prompt-mouvement collectées hors distribution, censé refléter des conditions réelles variées. Le principe central de GenTrack consiste à faire alterner deux étapes en ligne : un alignement du générateur de mouvements ancré dans l'exécution réelle et calculé de façon relative par groupe, puis un entraînement du tracker sur les nouvelles références ainsi produites, le tout stabilisé par des mécanismes d'ancrage et de rejeu pour limiter la dérive du modèle. L'enjeu technique visé est connu des équipes qui travaillent sur le contrôle des humanoïdes : les générateurs de mouvement texte-vers-mouvement, entraînés sur des données de capture humaine ou retargetées, produisent des trajectoires plausibles cinématiquement mais souvent inexécutables physiquement par un robot réel. Les approches existantes traitent ce problème dans un seul sens, en figeant soit le corpus généré, soit le tracker récompensé. GenTrack propose une boucle fermée entre les deux composants. Selon les auteurs, cette co-évolution en ligne améliore à la fois l'exécutabilité robotique des mouvements générés et la couverture zero-shot du tracker, avec un gain particulièrement marqué sur les références hors distribution, c'est-à-dire les cas les plus proches d'un usage industriel réel plutôt que d'un benchmark contrôlé. Le travail s'inscrit dans la lignée des recherches sur les modèles de suivi de mouvement génériques pour humanoïdes, où l'extension de la couverture zero-shot dépendait jusqu'ici de corpus embarqués coûteux à agrandir. GenTrack propose une alternative sans collecte de données supplémentaire, en exploitant plutôt un post-entraînement conjoint génération-suivi. L'article ne mentionne pas de déploiement industriel ni de partenaire matériel au-delà du G1 de Unitree utilisé comme plateforme d'évaluation ; il s'agit à ce stade d'une contribution méthodologique plutôt que d'un produit commercialisé.

RecherchePaper
1 source
PRISM : génération de données robotiques personnalisées par synthèse d'images de scènes et de mouvements
4arXiv cs.RO 

PRISM : génération de données robotiques personnalisées par synthèse d'images de scènes et de mouvements

Il n'y a pas de nom d'entreprise, de labo ou de deploiement commercial cité dans cet abstract (c'est un papier de recherche arXiv), donc l'article reste focalisé sur la méthode et ses résultats mesurés, sans inventer de contexte industriel absent du texte source. Des chercheurs présentent PRISM, un pipeline qui génère des jeux de données robotiques personnalisés à partir d'une seule image et d'une instruction en langage naturel, sans téléopération humaine. Le système construit des scènes dites "digital cousins" : des environnements synthétiques alignés sémantiquement et géométriquement avec l'environnement cible de l'utilisateur, mais suffisamment variés au niveau des instances (objets, agencements) pour éviter le surapprentissage. PRISM synthétise ensuite des démonstrations exécutables directement utilisables pour entraîner une politique robotique. Sur les benchmarks LIBERO et LIBERO-Plus, les politiques entraînées sur les données générées par PRISM surpassent celles entraînées sur des jeux de données de référence, et atteignent jusqu'à 100 % de taux de réussite sur trois tâches de manipulation réelles, avec une meilleure robustesse lorsque l'environnement de test diffère de celui vu à l'entraînement. L'enjeu ici est la collecte de données, principal goulot d'étranglement pour déployer des modèles vision-langage-action (VLA) au-delà des laboratoires. La téléopération produit des données bien alignées avec la tâche mais coûte cher et ne passe pas à l'échelle ; la simulation pure passe à l'échelle mais peine à ressembler à l'environnement réel de l'utilisateur final. PRISM tente de concilier les deux, ce qui intéresse directement les intégrateurs et décideurs B2B confrontés au coût de personnalisation d'un robot pour un site spécifique (usine, entrepôt, domicile) : si la génération de données synthétiques personnalisées tient ses promesses hors laboratoire, elle réduit un frein économique majeur à l'adoption des politiques génératives en robotique. Ce travail s'inscrit dans la vague plus large des modèles fondation VLA (dans la lignée de Pi-0, GR00T N2 ou Helix) qui cherchent à généraliser au-delà des tâches et environnements d'entraînement, un problème encore mal résolu malgré les démonstrations impressionnantes de ces modèles. Il fait aussi écho à la tendance du "sim-to-real" et à l'usage de scènes synthétiques proches mais non identiques à la réalité pour diversifier les données d'entraînement sans reproduire du réel coûteux. Les auteurs positionnent PRISM face à deux approches concurrentes existantes, la téléopération manuelle et la simulation générique, en montrant un gain de performance sur des benchmarks standards ainsi que sur des tâches de manipulation réelles. L'abstract ne précise pas de calendrier de déploiement ou de partenariat industriel : à ce stade, il s'agit d'un résultat de recherche à valider sur un périmètre de tâches plus large.

RechercheActu
1 source