Aller au contenu principal
GestAdapt : génération de gestes accompagnant la parole pour robots humanoïdes, conditionnée par l'espace de travail
RecherchearXiv cs.RO 

GestAdapt : génération de gestes accompagnant la parole pour robots humanoïdes, conditionnée par l'espace de travail

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv GestAdapt, un cadre de génération de gestes d'accompagnement de la parole (co-speech gestures) conditionné par l'espace de travail disponible pour les poignets du robot. L'idée de départ est que, pour une même phrase, plusieurs gestes sont plausibles. Un robot placé près d'un mur, par exemple, doit choisir un geste adapté à cette contrainte, et non produire un geste libre qu'on déformerait ensuite. Le système s'entraîne sur six corpus de gestes co-verbaux, réunis grâce à une représentation commune du mouvement, ce qui permet de retransposer les gestes vers différents robots. Dans l'étude utilisateurs, les gestes générés sous contraintes d'espace modifiées obtiennent une note moyenne de 3,24/5. La variante sans conditionnement d'espace obtient 2,43/5 et les mouvements de référence 3,68/5. Sur le robot humanoïde Reachy2, les mouvements issus de GestAdapt arrivent en tête dans 69,7 % des comparaisons. Tous les mouvements comparés sont soumis aux mêmes contraintes d'espace, y compris les mouvements humains de référence, retransposés puis contraints après coup.

Le résultat touche à un point peu visible des démonstrations d'humanoïdes : la gestuelle d'un robot de service ou d'accueil se déploie dans des lieux réels, avec des comptoirs, des cloisons, des passants, et pas dans une pièce dégagée. L'étude indique que contraindre le geste pendant sa génération donne de meilleurs résultats que de corriger a posteriori une trajectoire libre, au risque d'en dégrader le naturel. Pour les intégrateurs d'humanoïdes interactifs, cela plaide pour intégrer la géométrie de l'environnement dans le modèle de génération plutôt que dans une couche de filtrage en aval. Il faut toutefois relativiser. Avec 3,24/5, le système reste nettement sous les gestes humains de référence, et l'écart avec la variante sans contrainte (0,81 point) est mesuré dans une étude utilisateurs dont la taille d'échantillon n'est pas précisée dans le résumé. Le classement sur robot ne porte que sur un seul modèle.

Le choix de Reachy2 est notable pour l'écosystème européen. Ce bras-torse humanoïde est développé par Pollen Robotics, société française de la région bordelaise, et il sert de plateforme d'évaluation dans ce travail. Cela confirme sa place dans la recherche en interaction homme-robot, même si le résumé ne dit pas si l'équipe est liée à Pollen. GestAdapt s'inscrit dans la génération de gestes pilotée par la parole, qui repose surtout sur des modèles entraînés sur des données humaines, avec peu de prise en compte des limites physiques de l'espace de travail. Il s'agit d'une publication de recherche, sans produit, sans déploiement ni calendrier annoncés. Les prochaines étapes probables sont des évaluations sur d'autres morphologies et en conditions d'usage réelles, avec des contraintes d'espace plus variées.

Impact France/UE

Reachy2, bras-torse humanoïde de la société française Pollen Robotics, sert de plateforme d'évaluation, ce qui confirme son rôle dans la recherche européenne en interaction homme-robot.

À lire aussi

Robots humanoïdes : accélérer la génération de trajectoires par diffusion et distillation par cohérence
1arXiv cs.RO 

Robots humanoïdes : accélérer la génération de trajectoires par diffusion et distillation par cohérence

Une équipe de recherche propose un framework de planification de trajectoires contraintes pour bras manipulateurs en interaction homme-robot (HRI). Le point de départ : quand la pose de l'effecteur terminal est entièrement fixée, imposer en plus l'évitement de collisions et d'auto-collisions comme simple tâche secondaire dans l'espace nul devient difficile, ce qui complique la génération de trajectoires sûres. Les chercheurs génèrent d'abord, via les algorithmes RRT et RRT*, un jeu de données de trajectoires respectant ces contraintes, puis entraînent dessus un modèle de diffusion produisant des trajectoires articulaires par échantillonnage guidé. Une distillation de cohérence réduit ensuite le temps d'inférence, et un terme de régularisation du jerk pondéré par articulation est ajouté à la fonction de perte pour lisser les trajectoires. En simulation, le modèle de cohérence génère 150 candidats en moins de 100 millisecondes, avec un taux de réussite élevé, et la régularisation du jerk réduit nettement les à-coups articulaires et à l'effecteur terminal. Ce résultat vise un verrou concret pour les robots collaboratifs travaillant près d'humains : les planificateurs classiques par échantillonnage comme RRT sont trop lents pour du replanning temps réel, tandis que les modèles de diffusion, efficaces pour capturer des distributions de trajectoires contraintes, restent coûteux en inférence à cause du débruitage itératif. En ramenant la génération à quelques étapes sans perte visible de qualité, la distillation de cohérence rapproche les planificateurs appris de la latence exigée par un usage embarqué, un enjeu direct pour les intégrateurs de cobots industriels et les concepteurs de systèmes HRI, où la sécurité ne doit pas se payer en réactivité. Le travail s'inscrit dans la lignée des approches par diffusion appliquées à la planification de mouvement et à l'apprentissage par imitation en robotique, où la vitesse de génération reste le principal obstacle face aux contrôleurs classiques. Les modèles de cohérence, conçus à l'origine pour accélérer la génération d'images, sont ici transposés à la manipulation robotique pour contourner ce compromis vitesse-qualité. Les résultats restent toutefois cantonnés à la simulation : la validation sur bras robotique physique, avec perception humaine réelle, constitue l'étape logique suivante avant tout déploiement en environnement collaboratif.

RecherchePaper
1 source
GeCCo : une politique généraliste conditionnée par le contact pour la loco-manipulation des robots à pattes
2arXiv cs.RO 

GeCCo : une politique généraliste conditionnée par le contact pour la loco-manipulation des robots à pattes

GeCCo, pour Generalist Contact-Conditioned Policy, est une politique de bas niveau entraînée par apprentissage par renforcement profond (DRL) capable de suivre des points de contact arbitraires sur un robot quadrupède, décrite dans un article arXiv (2509.17582v2, version révisée). Plutôt que d'apprendre une politique de bout en bout spécifique à chaque tâche, les auteurs proposent une architecture hiérarchique modulaire où cette unique politique de suivi de contacts sert d'interface entre un planificateur de haut niveau et le contrôle bas niveau du robot. Le système a été testé sur un large éventail de tâches de locomotion et de manipulation avec une seule politique généraliste : différentes allures, franchissement de terrains complexes comme des escaliers et des pentes, traversée de pierres de gué et de poutres étroites jamais vues à l'entraînement, ainsi que des interactions physiques comme appuyer sur un bouton ou pousser un tonneau. L'intérêt principal pour l'industrie robotique tient à la promesse de rompre avec le goulot d'étranglement classique du RL en locomotion quadrupède : la définition et l'ajustement itératifs de fonctions de récompense pour chaque nouvelle application, un processus chronophage qui limite le passage à l'échelle. En stabilisant l'exécution des contacts malgré l'incertitude dynamique et les erreurs de planification, GeCCo permet d'échanger ou de composer des planificateurs (codés à la main, appris ou basés sur de l'optimisation) sans réentraîner la couche de contrôle. Pour des intégrateurs cherchant à combiner locomotion et manipulation sur une même plateforme, cela suggère la possibilité de construire de nouveaux comportements en assemblant un planificateur spécifique à la tâche avec une politique pré-entraînée générique, plutôt qu'en repartant de zéro à chaque fois. L'article se positionne face aux méthodes dominantes de RL end-to-end en locomotion quadrupède, qu'il cherche explicitement à dépasser en généralité et en modularité. Aucune affiliation industrielle ni partenaire commercial n'est mentionné dans le résumé, ce qui situe ce travail comme une contribution de recherche plutôt qu'une annonce produit. Des démonstrations vidéo sont disponibles sur le site du projet, vassil-atn.github.io/gecco.github.io, mais l'article ne précise ni feuille de route de déploiement ni pilote industriel annoncé.

RecherchePaper
1 source
EmoPose : génération de gestes sensibles aux émotions guidée par un modèle vision-langage pour robots humanoïdes
3arXiv cs.RO 

EmoPose : génération de gestes sensibles aux émotions guidée par un modèle vision-langage pour robots humanoïdes

Un article publié sur arXiv (2609.23414v1) présente EmoPose, un système associant un modèle vision-langage (VLM) et un contrôleur robotique déterministe pour générer des gestes porteurs d'émotion chez les robots humanoïdes : à partir d'un texte, d'un historique de dialogue et d'un contexte visuel optionnel, le VLM choisit un plan de gestes ordonné (classe communicative, variante, intensité, point d'ancrage vocal), puisé dans une bibliothèque de mouvements propre au robot qui fournit des cibles articulaires à 14 degrés de liberté (DoF). L'outil Pose Studio génère automatiquement les trajectoires, les prévisualise sous le simulateur MuJoCo et synchronise les nouvelles entrées avec le guide du VLM, tandis que des modules déterministes côté robot valident les plans, construisent les trajectoires et gèrent l'ordonnancement, la mise en file et l'interruption des gestes. Sur le banc d'essai EmoPose-Bench, une planification structurée avec GPT-5.5 atteint 98,25 % (± 0,52) sur le niveau facile et 76,50 % (± 0,54) au global, un score supérieur à un prompting à étiquette directe avec le même modèle. Le système exécute la suite nominale sous MuJoCo et reproduit les 29 variantes de la bibliothèque sur un robot Unitree G1 physique, démontré lors d'une visite de laboratoire en quatre étapes mêlant narration expressive avec interruption, dialogue ancré sur la caméra et navigation. Cette architecture répond à un problème concret pour les intégrateurs : confier le contrôle articulaire brut à un modèle de fondation reste imprévisible, tandis qu'un robot purement scripté manque de flexibilité sociale. En cantonnant le VLM à un rôle de sélection sémantique dans une bibliothèque de mouvements pré-validée et en laissant le contrôle bas niveau à des modules déterministes, EmoPose permet d'étendre le répertoire expressif à de nouveaux contextes sociaux sans modifier l'interface de contrôle ni recertifier la sécurité du mouvement. C'est un argument dans le débat sur le passage à l'échelle des modèles vision-langage-action (VLA) : plutôt que de démontrer qu'un VLA génère directement des trajectoires fiables de bout en bout, les auteurs montrent qu'un VLM peut piloter une bibliothèque de gestes pré-validés, approche plus proche de ce qu'un intégrateur industriel peut auditer et déployer en sécurité. Les chiffres de précision restent néanmoins issus d'un benchmark maison et d'une démonstration en laboratoire contrôlé, pas d'un déploiement en conditions réelles à grande échelle. EmoPose s'inscrit dans la vague de travaux cherchant à combler l'écart entre les modèles vision-langage-action généralistes, tels Pi-0 ou GR00T N2, et le besoin d'un contrôle fiable et spécifique à chaque corps physique ; contrairement à ces approches de génération de mouvement de bout en bout, EmoPose sépare explicitement raisonnement social et exécution motrice. Le choix du Unitree G1, plateforme humanoïde largement utilisée par les laboratoires de recherche pour son coût accessible, souligne la nature académique de la démonstration plutôt qu'un déploiement commercial. Les auteurs ne mentionnent ni partenaire industriel ni calendrier de commercialisation : à ce stade, la publication reste une validation de méthode sur banc d'essai et lors d'une visite de laboratoire, sans pilote client ni déploiement annoncé en environnement réel.

RecherchePaper
1 source
Speech2Grasp : transfert efficace de la détection de préhension conditionnée par le texte vers la parole chez les robots humanoïdes
4arXiv cs.RO 

Speech2Grasp : transfert efficace de la détection de préhension conditionnée par le texte vers la parole chez les robots humanoïdes

Des chercheurs publient sur arXiv (référence 2607.26567v1) Speech2Grasp, un framework qui transfère vers la parole une capacité jusque-là limitée au texte : la détection de préhension (grasp detection) chez les robots humanoïdes. Le point de départ est ALBEF, un modèle vision-langage établi utilisé comme cas d'étude. Les auteurs montrent par des analyses diagnostiques qu'un simple projecteur léger, un perceptron multicouche (MLP), suffit à adapter ALBEF à des entrées vocales, en conservant sa capacité de discrimination sémantique et sa robustesse. Sur cette base, l'équipe construit Speech2Grasp, un système entraîné de façon économe en données. Testé sur un robot humanoïde réel, il surpasse un pipeline classique en cascade, où la parole est d'abord transcrite par reconnaissance vocale (ASR) puis traitée comme du texte, tout en réduisant la latence d'inférence. Ce résultat comble un décalage fréquent dans l'interaction homme-robot : la plupart des systèmes de perception et de manipulation restent conditionnés par du texte, alors que la parole est le canal naturel pour un humain donnant des instructions. Passer par un pipeline ASR classique ajoute de la latence et propage les erreurs de transcription vers l'étape de compréhension. Pour les intégrateurs qui conçoivent des interfaces vocales pour humanoïdes, la démonstration qu'une adaptation légère et peu coûteuse en données suffit à conserver les performances d'un modèle texte est un signal pratique : elle suggère qu'il n'est pas nécessaire de réentraîner des modèles vision-langage entiers pour les rendre exploitables en environnement vocal réel. Le travail s'inscrit dans la vague plus large des modèles vision-langage-action (VLA), à l'image de GR00T N2, Pi-0 ou Helix, qui conditionnent tous leurs actions sur des instructions en langage naturel, généralement écrites. ALBEF, lui, vient de la recherche en pré-entraînement vision-langage, hors robotique. Speech2Grasp propose ainsi un paradigme de transfert potentiellement réutilisable pour d'autres systèmes texte-conditionnés du secteur, plutôt qu'une architecture figée. Les auteurs présentent leurs résultats comme une preuve de concept ; les prochaines étapes attendues porteraient sur l'extension à d'autres tâches de manipulation et à d'autres modèles VLA.

RecherchePaper
1 source