Aller au contenu principal
X2C : un ensemble de données d'expressions faciales nuancées pour l'imitation humanoïde réaliste
RecherchearXiv cs.RO 

X2C : un ensemble de données d'expressions faciales nuancées pour l'imitation humanoïde réaliste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie X2C, un jeu de données pour le transfert d'expressions faciales humaines vers des robots humanoïdes, en version 3 sur arXiv (2505.11146). Il compile 100 000 paires image/valeurs de contrôle, chaque expression étant annotée avec 30 paramètres de contrôle continus et physiquement contraints, donc exploitables sur du matériel réel et non seulement pour la synthèse vidéo. Les auteurs proposent aussi X2CNet, un framework en deux étapes qui sépare l'extraction du mouvement visuel de la régression vers les commandes mécaniques. Validé par des benchmarks quantitatifs et des tests physiques réels, le système affiche une meilleure cohérence inter-domaines et une imitation robuste en conditions non contrôlées, avec code et données publiés sur lipzh5.github.io/X2CNet.

Le verrou est concret: la dynamique faciale humaine, continue et haute-dimension, contraste avec les têtes robotiques limitées par un nombre restreint de degrés de liberté mécaniques et les contraintes physiques des actionneurs. L'absence de données appariées à grande échelle cantonnait jusqu'ici la recherche à des démonstrations isolées ou à des pipelines propriétaires fermés, peu comparables d'un laboratoire à l'autre. En publiant un jeu de données massif et densément annoté, X2C pose les bases d'un benchmark standardisé pour l'imitation faciale, un terrain où, contrairement à la locomotion ou la préhension, aucun outil d'évaluation commun n'existait vraiment. Pour les intégrateurs de robots d'accueil, de service ou compagnons, où l'expressivité faciale conditionne l'acceptabilité sociale, disposer d'une méthode reproductible et ouverte change la donne face aux démonstrations vidéo invérifiables.

Ce travail prolonge les progrès rapides de la synthèse visuelle de têtes parlantes, deepfakes et avatars numériques compris, un domaine mature côté génération d'image mais qui ne réglait pas le passage à des commandes physiques exploitables par un visage robotique réel. Sur le terrain des têtes expressives commerciales, plusieurs plateformes existent déjà, à l'image d'Ameca d'Engineered Arts ou des robots sociaux basés sur Furhat, mais avec des pipelines internes non comparables faute de référentiel commun. X2C se positionne comme cette référence ouverte, code et données publiés pour permettre des comparaisons reproductibles entre équipes. L'article demeure à ce stade un travail de recherche en preprint, sans partenariat industriel ni déploiement commercial annoncé; son adoption comme benchmark par d'autres laboratoires serait la suite logique.

Dans nos dossiers

À lire aussi

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes
1arXiv cs.RO 

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes

Une équipe de chercheurs du laboratoire DAVIAN a publié en juin 2026 PHUMA (Physically Reliable HUMAnoid locomotion dataset), un corpus de 73 heures de données de locomotion humanoide produit via un pipeline en deux étapes : une curation physiquement consciente suivie d'un retargeting contraint par des lois physiques. La base de données agrège à la fois des données de motion capture traditionnelles et des vidéos issues d'internet, les deux étant traitées pour éliminer les artefacts physiques récurrents dans les datasets existants, notamment le flottement, la pénétration géométrique et le foot skating. Entraînées sur PHUMA, les politiques de contrôle obtiennent des taux de succès supérieurs à ceux obtenus avec AMASS et Humanoid-X sur les benchmarks de motion tracking standards, et transfèrent en zero-shot vers un Unitree G1 réel. Le code et les données sont disponibles publiquement via davian-robotics.github.io/PHUMA. Le principal verrou que PHUMA prétend lever est la qualité physique des données d'entraînement pour l'imitation de mouvement humanoide. Les approches par imitation sont attractives parce qu'elles permettent d'acquérir des comportements naturels sans reward engineering fastidieux, mais leur efficacité dépend directement de la cohérence physique des données sources. Les artefacts présents dans les datasets basés sur des vidéos internet (comme Humanoid-X) se propagent dans les politiques entraînées, produisant des robots qui glissent ou oscillent de façon instable. La démonstration de transfert zero-shot sur un Unitree G1 physique est le point le plus concret : elle suggère que le filtrage physique en amont réduit effectivement le sim-to-real gap, sans fine-tuning additionnel sur hardware. Reste à qualifier l'ampleur du gain : les métriques de benchmarks internes ne se substituent pas à des comparaisons en conditions réelles standardisées. AMASS, publié en 2019, est resté longtemps la référence en motion capture humanoide, mais sa taille limitée et son coût d'acquisition ont freiné la scalabilité des approches data-driven. Humanoid-X a tenté de combler ce vide en exploitant des vidéos YouTube à grande échelle, au prix d'une dégradation qualitative. PHUMA s'inscrit dans une dynamique plus large où plusieurs équipes cherchent à constituer des datasets de locomotion humanoide à la fois volumineux et physiquement valides, en parallèle des travaux de Figure AI (Figure 03), Boston Dynamics, et des équipes derrière GR00T N2 chez NVIDIA. La prochaine étape logique serait de tester PHUMA sur d'autres plateformes humanoïdes commerciales (H1, Digit) et d'élargir les tâches au-delà de la locomotion simple vers la manipulation en déplacement.

UELe dataset PHUMA étant en accès libre, les équipes de recherche européennes en locomotion humanoïde (INRIA, CEA-List, LAAS-CNRS) peuvent l'intégrer directement dans leurs pipelines d'entraînement sans coût d'acquisition.

RecherchePaper
1 source
MobileOcc : un jeu de données d'occupation sémantique sensible à l'humain pour robots mobiles
2arXiv cs.RO 

MobileOcc : un jeu de données d'occupation sémantique sensible à l'humain pour robots mobiles

Une équipe de recherche publie MobileOcc, un jeu de données d'occupation sémantique 3D pour robots mobiles opérant en environnements piétons denses, un scénario peu couvert comparativement à la conduite autonome. L'article, référencé arXiv 2511.16949, décrit un pipeline d'annotation combinant occupation d'objets statiques et un nouveau cadre d'optimisation de maillage pour les humains : leur géométrie déformable est reconstruite à partir d'images 2D puis affinée avec des points LiDAR associés. Le jeu de données alimente deux benchmarks, la prédiction d'occupation et la prédiction de vitesse des piétons, testés avec des méthodes monoculaires, stéréo et panoptiques dotées de métriques et d'implémentations de référence reproductibles. La méthode d'annotation est aussi validée sur des jeux de données d'estimation de pose humaine 3D, avec des résultats jugés robustes ; le code et les données sont publiés sur autonomousrobots.nl. La perception d'occupation dense est une brique critique pour la navigation sécurisée des robots mobiles au contact d'humains, en entrepôt, en hôpital ou en espace public, où anticiper position et mouvement d'un piéton conditionne l'évitement de collision. La plupart des jeux de données d'occupation 3D existants visaient l'automobile, avec des scènes routières peu représentatives des couloirs et halls parcourus par les robots de service. Modéliser les humains comme des objets déformables plutôt que comme de simples boîtes englobantes, et publier des baselines multi-capteurs reproductibles, comble un manque de standardisation qui facilitera la comparaison des systèmes de perception chez les intégrateurs. Ce travail s'inscrit dans une tendance de transfert des techniques de perception nées pour la conduite autonome vers la robotique mobile et humanoïde, à mesure que LiDAR et architectures d'occupation 3D se banalisent. MobileOcc reste un jeu de données et un protocole d'évaluation académiques, sans déploiement industriel annoncé, et il s'agit d'une version corrigée de la publication initiale sur arXiv. L'ouverture du code et des données vise à établir une référence que d'autres laboratoires pourront reprendre pour comparer leurs modèles de perception en environnement piéton, chantier ouvert tant pour la recherche que pour de futurs usages commerciaux en robotique de service.

RecherchePaper
1 source
EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive
3arXiv cs.RO 

EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive

Un article de recherche publié sur arXiv sous la référence 2609.14432 (septembre 2026) présente EMoG, un framework de génération de démarche modulée par l'émotion pour la locomotion expressive de robots humanoïdes, construit autour d'un « code de style émotionnel » dont l'intensité est ajustable en continu. Combiné à des commandes physiques classiques (vitesse, direction), ce code alimente un réseau MLP léger qui génère en temps réel des trajectoires de démarche périodiques, expressives et cohérentes avec la commande demandée, ensuite exécutées par une politique unique d'apprentissage par renforcement. Pour l'entraînement, les auteurs ont constitué un jeu de données de démarches annotées par émotion auprès de performeurs professionnels, avec un pipeline automatisé extrayant des cycles de marche périodiques physiquement cohérents. EMoG intègre également un parseur basé sur un LLM convertissant des instructions en langage naturel libre en paramètres de style émotionnel et de mouvement, pour un contrôle interactif. Les expériences rapportées montrent une modulation continue du style de marche avec des signaux expressifs perceptibles, sans dégradation du suivi des commandes physiques. La plupart des systèmes de locomotion humanoïde se concentrent sur la stabilité et l'exécution de tâches, laissant l'expressivité émotionnelle de côté ou reléguée aux gestes du haut du corps plutôt qu'intégrée au contrôle de la marche lui même. En traitant l'émotion comme un paramètre continu du contrôleur de bas niveau plutôt que comme une couche cosmétique ajoutée après coup, EMoG ouvre la voie à des robots capables de signaler un état (prudent, enjoué, fatigué) par leur simple façon de marcher, sans sacrifier la précision de navigation attendue par les intégrateurs. C'est aussi un signal de plus que les interfaces en langage naturel pilotées par LLM s'imposent comme couche de contrôle au dessus des politiques d'apprentissage par renforcement de bas niveau, une tendance déjà visible dans les architectures vision langage action du secteur. Ce travail s'inscrit dans un champ encore jeune : la quasi totalité des efforts commerciaux sur les humanoïdes, stabilité de marche, manipulation, téléopération, ignore largement la dimension expressive, jugée secondaire face aux enjeux de fiabilité et de rentabilité industrielle. EMoG reste à ce stade un travail académique publié en preprint, sans plateforme robotique ni partenaire industriel nommés dans le résumé, et sans annonce de déploiement réel : les résultats proviennent d'expériences contrôlées, pas d'un déploiement en usine ou en environnement public. Il rejoint néanmoins un intérêt croissant pour l'expressivité robotique comme levier d'acceptabilité sociale, un axe que laboratoires et startups d'interaction humain robot devraient suivre de près pour des usages d'accueil, de service ou de robotique sociale, où la perception émotionnelle du geste compte autant que la performance motrice.

RecherchePaper
1 source
EATR-Stereo : routage sensible à l'incarnation des données stéréo appariées pour le contrôle VLA des humanoïdes
4arXiv cs.RO 

EATR-Stereo : routage sensible à l'incarnation des données stéréo appariées pour le contrôle VLA des humanoïdes

Une équipe de recherche présente EATR-Stereo (Embodiment-Aware Routing of Paired Stereo Evidence), un cadre de contrôle vision-langage-action (VLA) pour robots humanoïdes équipés de caméras stéréo montées sur la tête, décrit dans un article publié sur arXiv (référence 2608.17453v1, août 2026). Le système conserve les tokens de la vue primaire et construit des tokens auxiliaires inter-vues (Cross-View Auxiliary Tokens, CVAT) alignés sur cette vue en interrogeant la séquence de tokens de la vue auxiliaire synchronisée, tandis qu'un encodeur proprioceptif segmenté par partie du corps conditionne leur usage token par token sur l'historique de configuration du robot, le tout sans réentraîner le modèle vision-langage préentraîné. Testé sur un humanoïde physique à 33 degrés de liberté (DoF) et 37 dimensions d'état proprioceptif, sur neuf configurations et des tâches de recherche-approche-saisie-dépôt-retour dépassant 100 secondes, EATR-Stereo atteint 60,0% de réussite sur la tâche complète, 100,0% en saisie et 80,0% par étape ; en occlusion asymétrique sévère, son taux de récupération grimpe à 80%, contre 30% pour la seule méthode CVAT. Ces chiffres répondent à un problème concret des pipelines VLA actuels, qui jettent souvent l'information stéréo complémentaire ou fusionnent les observations additionnelles sans préserver le flux natif de la vue primaire ni l'adapter à la morphologie du robot. Pour les intégrateurs, la démonstration qu'un routage sélectif conditionné par la proprioception améliore la robustesse en occlusion partielle suggère qu'un gain de fiabilité en manipulation longue durée passe moins par davantage de capteurs que par une meilleure architecture de routage de l'information déjà disponible. Les études d'ablation nuancent toutefois l'enthousiasme : retirer la préservation des tokens primaires ou le routage proprioceptif structuré dégrade nettement les performances, ce qui écarte l'idée que la stéréo seule suffirait à améliorer l'ancrage spatial. Le travail s'inscrit dans la lignée des architectures VLA pour humanoïdes, dans un contexte où des modèles comme Pi-0 ou GR00T N2 ont déjà prouvé la viabilité de politiques généralistes entraînées sur de larges corpus multimodaux, mais restent souvent limités à une seule vue caméra. En gardant le modèle vision-langage gelé et en n'ajoutant qu'un module de routage léger, l'approche vise la compatibilité avec les pipelines VLA existants plutôt qu'un réentraînement complet, une contrainte clé pour l'adoption industrielle. À ce stade, il s'agit d'une contribution académique validée sur une seule plateforme et un nombre limité de configurations, sans annonce de déploiement commercial ni de partenariat industriel ; la suite logique serait une validation sur d'autres humanoïdes et un éventail plus large de tâches de manipulation.

RechercheOpinion
1 source