Aller au contenu principal
RecherchearXiv cs.RO 

Projection multimodale de l'activité vocale pour la médiation robotique sociale : comportement attendu et contraintes de déploiement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente, dans une preprint arXiv publiée en septembre 2026 (arXiv:2609.28317v1), un modèle baptise MM-VAP (Multimodal Voice Activity Projection), conçu comme une couche de perception pour des robots sociaux appelés a jouer un rôle de médiateur dans des interactions humain-humain plutôt que d'interlocuteur direct. Le système combine des encodeurs audio-visuels pré-entraines spécialisés dans l'activité vocale, une adaptation LoRA (low-rank adaptation) et un mécanisme d'attention inter-locuteurs pour estimer, a partir de flux audio et vidéo synchronises, l'évolution future du floor conversationnel, c'est-a-dire qui va parler, se taire ou intervenir. A partir de ces projections, le modèle infère en zero-shot des événements de tour de parole : maintien (Hold), changement de locuteur (Shift), anticipation de changement (Shift prédiction), anticipation de back-channel (signaux d'écoute active) et états de chevauchement de parole. Les auteurs testent l'approche sur trois corpus de dialogues filmes, NoXi, NoXi+J et Haru EDR, et rapportent des résultats juges encourageants notamment pour les événements de gestion du floor lies a la préparation du regard, a l'écoute active et a une intervention prudente du robot. Le papier propose également une interface de sortie destinée a un robot réel et discute des contraintes de déploiement : inférence temps réel, latence de pre-traitement, synchronisation multimodale et surveillance de la qualité des entrées.

L'intérêt de ce travail dépasse le cas d'usage étroit du dialogue humain-robot classique : il s'attaque a un problème différent de la plupart des robots vocaux actuels, conçus pour répondre a un utilisateur, en visant des robots capables de se positionner dans une conversation entre deux ou plusieurs humains sans y participer directement, ce qui suppose de savoir quand ne pas parler, orienter le regard, attendre, éviter d'interrompre ou préparer une intervention équilibrée. Pour les intégrateurs et chercheurs en robotique sociale, cela déplace le curseur des métriques de reconnaissance vocale classiques vers une prédiction fine et anticipée de la dynamique conversationnelle, utile pour des robots de médiation, d'accueil ou d'assistance en groupe. Le travail rappelle aussi que la prédiction de tour de parole reste, a ce stade, un problème de recherche : les auteurs eux-mêmes cadrent leurs résultats comme un support de faisabilité et non comme une solution prête a déployer, et consacrent une part explicite du papier aux contraintes concrètes, latence, synchronisation, qualité des flux d'entrée, qui séparent un modèle valide hors ligne d'un système embarque fonctionnant en temps réel sur un robot physique.

Ce travail s'inscrit dans la lignée des modèles dits VAP (Voice Activity Projection), une famille d'approches de prédiction du tour de parole issue de la recherche en traitement du dialogue parle, ici étendue au multimodal (audio et vidéo) et adaptée via LoRA pour réduire le cout d'entrainement par rapport a un reentrainement complet des encodeurs pré-entraines. Contrairement aux annonces de robots humanoïdes commerciaux structurées autour de la manipulation ou de la locomotion, ce papier se situe dans le champ plus restreint de la robotique sociale et de l'interaction humain-robot, publie comme une preprint académique sans mention de partenaire industriel, de robot physique spécifique ou de calendrier de déploiement. Les auteurs indiquent avoir défini une interface de sortie destinée a un robot réel, ce qui laisse présager une prochaine étape d'intégration et de test sur plateforme physique, mais aucun pilote ni échéance n'est précise a ce stade.

Dans nos dossiers

À lire aussi

Robotique sociale : projection multimodale de l'activité vocale pour la gestion des tours de parole avec des encodeurs préentraînés liés à l'activité vocale
1arXiv cs.RO 

Robotique sociale : projection multimodale de l'activité vocale pour la gestion des tours de parole avec des encodeurs préentraînés liés à l'activité vocale

Les chercheurs à l'origine de ce travail présentent MM-VAP (Multimodal Voice Activity Projection), un système de prédiction des tours de parole conçu pour les robots sociaux impliqués dans des interactions humain-humain, en particulier en contexte de médiation. Contrairement à l'approche VAP originale qui ne traite que l'audio, MM-VAP synchronise les flux audio et visuel tout en conservant l'objectif d'apprentissage auto-supervisé de projection future. Le système s'appuie sur des architectures audio-visuelles pré-entraînées, initialement conçues pour des tâches liées à la parole, adaptées au problème du tour de parole via la technique LoRA (Low-Rank Adaptation), qui permet un fine-tuning léger sans réentraîner l'intégralité des poids. Après un encodage indépendant de chaque locuteur, une couche d'attention inter-locuteurs modélise les dynamiques relationnelles nécessaires pour anticiper l'activité vocale future, complétée par une fonction de perte de cohérence sémantique régularisant un espace de sortie à 256 états selon des patterns de dialogue de plus haut niveau. Les tests ont été menés sur les corpus NoXi et NoXi+J, avec une évaluation complémentaire sur le corpus Haru EDR. Ce travail s'inscrit dans un enjeu clé pour les robots conversationnels et sociaux : anticiper la dynamique d'une conversation plutôt que réagir mécaniquement aux silences, ce qui reste un point faible des systèmes de dialogue actuels. Pour les concepteurs de robots de médiation ou d'assistance sociale (accueil, animation de réunion, robots compagnons), une meilleure prédiction des tours de parole se traduit directement par des interactions moins mécaniques et plus naturelles. Les résultats montrent des améliorations par rapport aux références existantes, notamment sur certains types spécifiques d'événements de tour de parole, ce qui suggère que l'ajout de la modalité visuelle apporte un signal réellement exploitable, au-delà du simple audio, pour ce type de tâche. Le champ du "turn-taking" prédictif s'appuie historiquement sur des modèles purement acoustiques, le cadre VAP servant de référence. Cette extension multimodale s'inscrit dans une tendance plus large de l'interaction humain-robot consistant à combiner plusieurs canaux sensoriels pour améliorer la robustesse des modèles conversationnels, avec le corpus Haru comme banc d'essai orienté robotique de médiation, ouvrant la voie à des évaluations sur des plateformes robotiques réelles au-delà des corpus d'interaction humain-humain enregistrés.

RecherchePaper
1 source
M2R2 : représentation robotique multimodale pour la segmentation temporelle des actions
2arXiv cs.RO 

M2R2 : représentation robotique multimodale pour la segmentation temporelle des actions

Des chercheurs ont publié fin avril 2025 sur arXiv (2504.18662) un extracteur de représentations multimodal baptisé M2R2 (MultiModal Robotic Representation for Robotic TAS), conçu pour la segmentation temporelle d'actions (TAS) en robotique. L'approche combine des informations proprioceptives (encodeurs, capteurs force-couple, état des articulations) et extéroceptives (caméras RGB) dans un extracteur de features commun, accompagné d'une stratégie d'entraînement inédite permettant la réutilisation de ces représentations sur plusieurs architectures de segmentation indépendantes. Les résultats annoncés positionnent M2R2 à l'état de l'art sur trois jeux de données de référence en robotique : REASSEMBLE (assemblage de composants), (Im)PerfectPour (versage de liquide) et JIGSAWS (chirurgie robotique laparoscopique simulée). Une étude d'ablation extensive quantifie la contribution respective de chaque modalité. L'intérêt principal de M2R2 réside dans la modularité de son extracteur : les approches multimodales existantes en robotique fusionnaient les modalités directement à l'intérieur du modèle de segmentation, rendant les features non réutilisables entre architectures. Ici, le découplage extracteur/modèle de TAS ouvre la voie à une bibliothèque de représentations partageable, ce qui réduit le coût de réentraînement lors du changement de tâche ou de robot. Sur les scénarios à faible visibilité d'objet, les extracteurs purement visuels issus du computer vision chutent en performance, là où l'ajout de la proprioception maintient la robustesse. C'est un résultat concret sur la fragilité des approches vision-seule dans des environnements industriels ou chirurgicaux réels, où occlusions et éclairage variable sont la norme. La segmentation temporelle d'actions est un verrou historique pour l'autonomie des robots manipulateurs : sans identifier les frontières entre skills (saisir, aligner, visser...), il est impossible de planifier, corriger ou réutiliser des séquences de gestes. En chirurgie robotique, JIGSAWS est le benchmark de référence depuis 2016, utilisé notamment dans les travaux autour des plateformes da Vinci (Intuitive Surgical). En robotique industrielle, des acteurs comme Wandercraft ou les équipes de manipulation de Boston Dynamics s'appuient sur des approches similaires pour les transitions de phases motrices. M2R2 reste à ce stade une contribution de recherche académique sans déploiement industriel annoncé, mais son extracteur réutilisable représente un candidat sérieux pour des pipelines d'imitation learning dans lesquels labelliser chaque skill manuellement est le principal goulot d'étranglement.

UEL'extracteur modulaire M2R2 pourrait bénéficier aux équipes de manipulation françaises (notamment Wandercraft) en réduisant le coût de labellisation dans les pipelines d'imitation learning, mais reste une contribution académique sans déploiement industriel annoncé.

RecherchePaper
1 source
Séparation comportement-exécution pour l'interaction physique homme-robot contrainte
3arXiv cs.RO 

Séparation comportement-exécution pour l'interaction physique homme-robot contrainte

Des chercheurs proposent, dans une prépublication arXiv (2609.00669v1) du 2 septembre 2026, une architecture qui sépare la spécification du comportement souhaité et sa réalisation contrainte dans les interactions physiques homme-robot. Une couche comportement calcule une accélération désirée au point de contact, ak^id = ftheta(ek, ėk, F_h,k), tandis qu'une couche réalisation distincte la convertit en commandes robot sous contraintes et rapporte explicitement l'écart entre accélération désirée et réalisée, plutôt que de le masquer par saturation. Le système, un programme quadratique à horizon glissant, est testé sur un bras Franka FR3 à 7 degrés de liberté, à commande en couple, simulé sous MuJoCo. Sous une poussée soutenue de 20 newtons, la limite de l'espace de travail est respectée à environ 0,1 à 0,2 mm près, contre un dépassement de 4,4 cm en contrôle d'impédance classique et 4,7 cm en admittance, deux méthodes qui écrêtent instantanément les commandes. Avec un budget d'actionneur réduit, l'application des contraintes sur tout l'horizon garde le plan faisable à 2,1x10^-4 N.m près, contre un dépassement pouvant atteindre 11,329 N.m pour une variante qui ne contraint que le premier pas de calcul. Sur le système non linéaire réellement exécuté, l'écart se réduit mais reste favorable à l'approche par horizon complet, 0,161 contre 0,380 N.m. Cette séparation architecturale intéresse les intégrateurs de robots collaboratifs et humanoïdes en contact physique répété avec des humains ou des objets, un domaine où le contrôle d'impédance et d'admittance restent la norme malgré des dépassements de plusieurs centimètres lors de chocs ou de poussées. En rendant l'erreur de réalisation visible plutôt que dissimulée dans la saturation, l'approche facilite le diagnostic et la certification de sécurité des systèmes à interaction physique, un enjeu central pour les cobots industriels et les humanoïdes partageant des tâches avec des opérateurs. Elle montre aussi qu'un changement de comportement, par exemple passer d'un mode impédance à un mode admittance, peut s'effectuer en modifiant seulement les coefficients d'objectif du solveur sans reconstruire toute la boucle de commande, ce qui simplifierait le déploiement de comportements adaptatifs en temps réel. Le travail s'inscrit dans la lignée du contrôle d'impédance et d'admittance, formalismes classiques de l'interaction homme-robot, en cherchant à corriger leur principal défaut, la gestion approximative des contraintes par écrêtage instantané. La validation reste circonscrite à un cas d'étude planaire et à une seule plateforme robotique en simulation, ce que les auteurs présentent eux-mêmes comme une preuve de concept ciblée plutôt qu'un système prêt au déploiement industriel. Les prochaines étapes attendues incluent l'extension à des tâches tridimensionnelles, à d'autres architectures robotiques, et une validation sur matériel réel au-delà de la simulation MuJoCo.

UELe bras robotique utilisé pour les tests, le Franka FR3, est fabriqué par l'entreprise allemande Franka Robotics, mais aucun déploiement ni application concrète en France ou en UE n'est mentionné.

RecherchePaper
1 source
Planification par réseau de neurones en graphe et contrôle prédictif pour la planification de mouvement multi-robots sans étiquettes sous contraintes de communication
4arXiv cs.RO 

Planification par réseau de neurones en graphe et contrôle prédictif pour la planification de mouvement multi-robots sans étiquettes sous contraintes de communication

Une équipe de chercheurs propose, dans un preprint déposé sur arXiv le 25 mai 2026 (arXiv:2605.19209), un framework hiérarchique pour résoudre le problème de planification de mouvement multi-robots sans étiquetage, c'est-à-dire l'assignation simultanée de robots à des objectifs et la génération de trajectoires sûres dans des environnements partagés. Le système combine deux composants : un Graph ATtention Planner (GATP), fondé sur des réseaux de neurones à graphes avec mécanisme d'attention, qui génère des sous-objectifs intermédiaires par coopération entre agents, et un contrôleur NMPC (Nonlinear Model Predictive Controller) décentralisé, exécuté en embarqué sur chaque robot, qui garantit la faisabilité des trajectoires sous dynamiques non-linéaires et contraintes d'actuation réelles. Le framework a été évalué à la fois en simulation et sur des quadrotors physiques. Les auteurs rapportent une tolérance aux délais de communication allant jusqu'à 200 ms, une inférence entièrement décentralisée à bord, et une meilleure généralisation à des équipes de taille croissante. Ce travail s'attaque directement au gouffre sim-to-real qui mine la plupart des approches GNN appliquées à la robotique multi-agents : les méthodes existantes supposent des dynamiques simplifiées et un environnement de simulation idéalisé, ce qui les rend fragiles en conditions réelles. En couplant un planificateur neuronal décentralisé à un contrôleur à modèle prédictif, le framework maintient les propriétés de scalabilité des GNN tout en imposant des garanties de sécurité physiques que les approches purement apprises ne fournissent pas. La robustesse aux délais de communication est particulièrement significative pour les déploiements en entrepôts ou en milieu industriel, où les réseaux sans fil ne sont jamais idéaux. Cette contribution s'inscrit dans un corpus actif de recherche sur les GNN pour la coordination multi-robots, aux côtés de travaux comme MAGAT ou DAN, qui visent à remplacer les solveurs centralisés classiques (MILP, CBS) par des approches distribuées passant à l'échelle. Le preprint n'est pas encore soumis à une revue avec comité de lecture, et aucun déploiement industriel ni partenariat n'est annoncé : il s'agit d'une validation expérimentale académique sur quadrotors, prometteuse mais à consolider. Les prochaines étapes naturelles seraient des expériences sur flottes plus larges et des robots à dynamiques plus complexes, comme des manipulateurs mobiles ou des AMR en environnement entrepôt.

RecherchePaper
1 source