Aller au contenu principal
Validation de la réalité virtuelle pour l'étude de l'interaction humain-robot multimodale en navigation sociale de robots
RecherchearXiv cs.RO 

Validation de la réalité virtuelle pour l'étude de l'interaction humain-robot multimodale en navigation sociale de robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a testé si la réalité virtuelle (VR) permet d'étudier fidèlement les interactions humain-robot dans des scénarios de navigation sociale partagée. L'étude, menée avec 21 participants, a comparé leurs réactions face à un robot mobile manipulateur PR2 dans deux conditions identiques : une arène réelle équipée de capture de mouvement, et sa réplique virtuelle immersive en VR. Deux situations classiques de co-navigation ont été examinées, le croisement orthogonal et le dépassement latéral (pass-by). Les chercheurs ont recueilli à la fois des mesures subjectives, la perception de la conscience sociale du robot et le confort ressenti par les participants, et des données comportementales objectives, trajectoires de déplacement et orientation de la tête, pour comparer précisément les deux environnements. Résultat central : les participants perçoivent la navigation socialement consciente du robot de façon similaire dans les deux conditions, et les comportements observés en VR, trajectoires évitées, orientations du regard, correspondent à ceux mesurés en conditions réelles.

Cette validation compte pour tout le secteur de la robotique sociale et des humanoïdes déployés en environnement partagé avec des humains, entrepôts, usines, espaces publics. Concevoir et tester des algorithmes de navigation socialement acceptable exige normalement des essais physiques coûteux, lents et parfois risqués pour les sujets humains. Si la VR reproduit fidèlement les dynamiques d'interaction multimodale, comme le suggèrent ces résultats, elle devient un outil d'itération rapide et sûr pour les équipes qui développent des comportements de navigation robotique, avant tout déploiement réel. C'est aussi une réponse partielle à un scepticisme répandu dans le secteur sur l'écart entre les études HRI menées en environnement contrôlé ou simulé et le comportement humain effectif face à un robot physique.

Ce travail s'inscrit dans une lignée de recherches antérieures ayant déjà exploré la VR pour la navigation robotique socialement consciente, mais sans jamais confirmer explicitement que les dynamiques d'interaction multimodale observées en réel s'y retrouvaient. Le protocole within-subjects, chaque participant testant les deux conditions, renforce la robustesse de la comparaison. Les auteurs positionnent leur prototype VR comme une plateforme flexible pour de futures études sur des interactions humain-robot plus riches, ouvrant la voie à des campagnes de test à plus grande échelle sans dépendre systématiquement d'un robot physique et d'une arène de capture de mouvement, deux ressources rares et coûteuses dans les laboratoires de recherche en robotique.

À lire aussi

Évaluation physiologique multimodale de l'interaction physique humain-robot à contacts intensifs en conditions variables
1arXiv cs.RO 

Évaluation physiologique multimodale de l'interaction physique humain-robot à contacts intensifs en conditions variables

Une équipe de chercheurs a publié une étude empirique multimodale portant sur l'interaction physique humain-robot (pHRI) dans des conditions environnementales variables. Le protocole a soumis des opérateurs humains à 18 combinaisons distinctes de température, bruit acoustique et niveau d'éclairement, pendant l'exécution de tâches de traçage en contact direct avec un robot. Les chercheurs ont enregistré simultanément l'activité électrodermale (EDA), l'électromyographie de surface (sEMG), des données d'eye-tracking et des évaluations subjectives du confort. Résultat principal : la performance d'exécution est restée stable à travers toutes les conditions, mais la charge autonomique, mesurée par le niveau de conductance cutanée (SCL), a augmenté significativement avec la température. Les charges physique et cognitive, elles, n'ont pas varié de façon notable. Ces résultats mettent en évidence un mécanisme de compensation physiologique : les opérateurs maintiennent leur niveau de performance en augmentant leur effort biologique pour supprimer l'inconfort thermique, sans que cela ne soit visible dans les métriques de tâche classiques. C'est une distinction critique pour les intégrateurs et les concepteurs de systèmes cobotiques industriels : une évaluation centrée uniquement sur la performance (temps de cycle, taux d'erreur) peut masquer un coût opérateur réel, notamment en environnements chauds ou bruyants. Le fait que le confort perçu ne corrèle pas avec l'erreur de traçage ni le temps d'exécution invalide l'hypothèse courante que la performance se dégrade avec l'inconfort ressenti. Ce travail s'inscrit dans un courant de recherche croissant sur les architectures de contrôle "physiology-aware", où les signaux biologiques temps réel de l'opérateur alimentent la boucle de commande du robot pour adapter son comportement à l'état de charge de l'humain. La robotique collaborative industrielle, notamment dans des secteurs comme l'automobile ou la logistique, où les conditions thermiques et sonores sont variables, constitue le terrain d'application naturel. Des systèmes comme les cobots Universal Robots ou KUKA devront intégrer ce type de feedback pour répondre aux exigences ergonomiques croissantes des régulateurs européens. Les prochaines étapes identifiées par les auteurs incluent le développement de pipelines de traitement de signal adaptatifs capables d'exploiter ces métriques physiologiques en conditions non structurées.

UELes fabricants de cobots européens (KUKA, Universal Robots) et les régulateurs ergonomiques UE sont directement concernés : cette étude démontre que les métriques de performance classiques masquent un coût physiologique réel chez l'opérateur, ce qui invalide les protocoles d'évaluation actuels et anticipe des exigences réglementaires renforcées pour les déploiements cobotiques industriels en Europe.

RecherchePaper
1 source
Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation
2arXiv cs.RO 

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation

Une étude soumise en mai 2025 sur arXiv (référence 2605.00963) présente une analyse par ablation d'un système de manipulation robotique piloté par interaction homme-robot multimodale, appliqué à une tâche de détection et saisie d'objets. Les chercheurs ont ciblé trois modules du pipeline : le modèle de langage chargé d'extraire les actions à partir d'instructions verbales, le système de perception assurant l'ancrage visuel des objets cibles, et le contrôleur gérant l'exécution du mouvement. L'étude compare trois LLM distincts, cinq configurations de perception, et trois contrôleurs, avant de soumettre les meilleures combinaisons à une analyse factorielle croisée en seconde phase. L'objectif déclaré n'est pas de redessiner le pipeline, mais d'isoler la contribution de chaque composant sous un protocole expérimental commun. Cette approche répond à une question directement actionnable pour les intégrateurs et ingénieurs robotiques : quel module optimiser en priorité pour améliorer le taux de succès, et lequel pour réduire le temps d'exécution ? Dans un contexte industriel, ces deux métriques obéissent à des contraintes distinctes selon les postes de travail, et les confondre dans une évaluation globale masque les vrais leviers d'amélioration. La méthodologie par ablation reste encore rare dans les publications de manipulation robotique, où la tendance est d'évaluer un seul composant à la fois, ce qui rend les résultats difficiles à reproduire ou à transposer d'un système à l'autre. Les auteurs précisent que l'analyse vise aussi à orienter les choix d'ingénierie dans les prochaines versions du système. Ce travail s'inscrit dans un effort plus large de la communauté pour rendre opérationnels les pipelines de manipulation guidés par langage hors des environnements contrôlés de laboratoire. Sur le plan concurrentiel, deux écoles s'affrontent actuellement : les modèles unifiés de type VLA (Vision-Language-Action) entraînés à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, et les pipelines modulaires qui préservent la séparabilité des composants pour faciliter le débogage et l'adaptation sectorielle. L'étude n'annonce pas de déploiement industriel et reste pour l'instant au stade de la validation expérimentale. La prochaine étape logique serait de tester si les gains mesurés en laboratoire résistent au sim-to-real gap, qui demeure le principal obstacle à la mise en production des systèmes de manipulation guidés par instructions en langage naturel.

RecherchePaper
1 source
Développement d'un prototype de robot humanoïde pour l'interaction homme-robot multimodale
3arXiv cs.RO 

Développement d'un prototype de robot humanoïde pour l'interaction homme-robot multimodale

Des chercheurs présentent un prototype de robot humanoïde conçu comme plateforme de test pour l'interaction homme-robot multimodale, détaillé dans un article publié sur arXiv le 5 septembre 2026. Le système repose sur un mécanisme bimanuel à 12 degrés de liberté et une tête à 2 DOF équipée d'un écran LCD expressif capable de simuler des émotions faciales. L'ensemble du matériel est piloté par une carte contrôleur conçue sur mesure, avec traitement IA embarqué en temps réel via un module Jetson. Trois modules d'intelligence artificielle sont intégrés : reconnaissance gestuelle (MediaPipe Pose combiné à un classifieur LSTM), détection d'objets avec localisation 3D (YOLO), et traitement de commandes vocales par reconnaissance de la parole couplée à un modèle de langage (LLM) pour l'analyse sémantique. Les tests de validation rapportent une erreur moyenne de manipulation d'environ 1,83 cm en précision de positionnement, une précision de tâche globale supérieure à 90%, avec 96% pour la reconnaissance gestuelle et 92% pour la reconnaissance vocale. Ce prototype illustre une tendance de fond dans la recherche robotique : plutôt que de viser des démonstrations spectaculaires, l'accent est mis sur la reproductibilité et l'accessibilité d'une plateforme complète pour l'intégration de modules IA hétérogènes. Pour les laboratoires académiques et les équipes d'intégration disposant de budgets limités, disposer d'une architecture bimanuelle documentée, avec carte de contrôle personnalisée et pipeline multimodal (vision, geste, voix) déjà assemblé, réduit la barrière d'entrée pour prototyper des interactions homme-robot sans dépendre des plateformes commerciales fermées. Les chiffres de précision restent toutefois issus d'un cadre expérimental contrôlé et ne permettent pas de conclure directement sur une robustesse en environnement industriel réel, un point que l'article ne détaille pas davantage. Le projet s'inscrit dans la lignée des travaux académiques sur les robots compagnons et assistants, où l'expressivité faciale et la fusion de plusieurs canaux de perception (vision, geste, parole) sont recherchées pour rendre l'interaction plus naturelle. Contrairement aux humanoïdes commerciaux orientés manipulation industrielle comme Figure 03 ou Optimus, ce prototype cible explicitement la recherche en HRI et le prototypage reproductible plutôt qu'un déploiement en usine. L'article ne précise ni le nom de l'institution porteuse, ni de calendrier de diffusion ou de partenariat industriel, ce qui situe cette publication au stade de la recherche académique plutôt que d'une annonce produit.

RecherchePaper
1 source
PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots
4arXiv cs.RO 

PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots

La recherche présentée dans l'article arXiv:2609.18125v1 (déposé fin septembre 2026) porte sur un système baptisé PRISM, pour Predictive Representation of Interaction Style and Motion, conçu pour améliorer la navigation des robots dans les foules humaines. Concrètement, PRISM utilise un encodeur transformer entraîné avec une fonction de perte dite Rank-N-Contrast pour transformer les trajectoires observées de piétons en un espace latent continu et ordonné, qui capture le style d'interaction de chaque personne plutôt que sa seule position géométrique. Le système associe à chaque trait inféré un score de stabilité temporelle, transmis ensuite à la politique de navigation du robot. Les auteurs rapportent des résultats obtenus dans des simulations de foules randomisées : une réduction du taux de collisions par rapport à une référence qui ne modélise que l'état géométrique des piétons, ainsi que des gains marginaux sur le temps de trajet et la longueur du chemin parcouru. L'enjeu dépasse la seule performance chiffrée. La plupart des politiques de navigation sociale actuelles traitent les piétons comme de simples obstacles mobiles décrits par leur position et leur vitesse, ignorant que deux personnes se comportent différemment face à un robot selon leur style d'interaction propre. En inférant ce style de façon passive, sans capteurs additionnels ni interaction explicite, PRISM ouvre une piste pour des robots de livraison, des AMR ou des plateformes d'assistance appelés à circuler dans des environnements humains denses, où la sécurité perçue dépend autant du comportement social du robot que de sa seule évitement de collision. Le travail s'inscrit dans la lignée des recherches en navigation sociale robotique qui cherchent à dépasser les modèles purement géométriques hérités de la planification de trajectoire classique. Il reste toutefois à un stade de validation en simulation uniquement : aucun essai sur robot physique ni déploiement réel n'est mentionné, et les gains rapportés sur le temps de trajet et la distance parcourue sont qualifiés eux-mêmes de modestes par les auteurs. La suite logique, non annoncée à ce stade, serait un transfert vers des plateformes réelles pour vérifier si l'amélioration observée en simulation résiste au bruit des capteurs et à la variabilité humaine réelle.

RecherchePaper
1 source