
EMODY Flow : génération de mouvements corporels complets pilotée par l'audio et sensible aux émotions
Des chercheurs ont présenté EMODY Flow, un framework de flow-matching léger d'environ 35 millions de paramètres capable de générer gestes corporels et expressions faciales synchronisés avec la parole et l'émotion, dans un article publié sur arXiv le 16 septembre 2026 (arXiv:2609.16011v1). Le système se greffe sur un modèle Qwen-3 Omni figé et réutilise ses codecs audio internes Mimi, conçus à l'origine par le laboratoire français Kyutai, pour piloter deux générateurs DiT parallèles : l'un produit une pose corporelle au format SMPL-X, l'autre une expression faciale au format FLAME. Sur le benchmark de gestes BEAT2, le système revendique un nouvel état de l'art avec un FGD de 0,302, une corrélation au rythme de 0,853 et une diversité de 24,62, soit des gains de 26 %, 5 % et 62 % sur les meilleurs résultats antérieurs, et transfère en zero-shot vers l'animation faciale du jeu TFHP sans réglage spécifique au domaine.
L'apport principal tient au diagnostic d'un biais connu des générateurs conditionnels : recevant à la fois un embedding audio riche et une simple étiquette d'émotion discrète, un modèle de flow-matching ignore cette dernière et produit un mouvement quasi identique quelle que soit l'émotion demandée. Un classifieur d'émotion auxiliaire, actif seulement pendant l'entraînement, force le mouvement généré à rester reconnaissable émotionnellement, ce qui corrige ce défaut. Pour les concepteurs d'agents conversationnels incarnés, d'avatars et de robots humanoïdes, qui doivent exprimer un état émotionnel crédible en plus de synchroniser gestes et parole, cette méthode dépasse le seul cas testé. Il s'agit toutefois d'un résultat de recherche validé sur benchmarks, pas d'un produit livré ni d'un déploiement réel en conditions industrielles.
Le travail part d'un constat plus large : les grands modèles de langage omni-modaux comme Qwen-3 Omni, développé par Alibaba, excellent en compréhension multimodale mais ne produisent que du texte, laissant un vide dans la génération de réponses incarnées pour les agents conversationnels. EMODY Flow s'appuie sur des formats de référence du secteur, SMPL-X pour le corps et FLAME pour le visage, ainsi que sur le benchmark BEAT2 utilisé pour comparer les méthodes de génération de gestes co-verbaux. L'article ne mentionne aucun partenaire industriel ni calendrier de déploiement : il s'agit d'une contribution académique destinée à être reprise par la communauté recherche en animation et en agents incarnés.
Le codec audio Mimi, développé par le laboratoire français Kyutai, est réutilisé comme composant clé du système, illustrant le rayonnement international d'une technologie open-source française.
Dans nos dossiers




