Aller au contenu principal
FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole
RecherchearXiv cs.RO 

FAM-HRI : interaction humain-robot multimodale assistée par modèle fondation, combinant regard et parole

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié en mars 2025 sur arXiv (référence 2503.16492, troisième révision) FAM-HRI, un framework multimodal d'interaction humain-robot combinant le suivi du regard et la parole via des modèles de fondation. Le système s'appuie sur les lunettes Meta ARIA, un dispositif de recherche léger, pour capturer en temps réel les signaux visuels et vocaux de l'utilisateur. Ces données sont fusionnées par un grand modèle de langage (LLM) qui interprète l'intention de l'utilisateur en la croisant avec le contexte visuel de la scène, permettant au robot d'identifier et manipuler des objets désignés par le regard. Un algorithme dédié détermine l'intervalle temporel de fixation oculaire afin de filtrer le bruit inhérent aux mouvements naturels des yeux. Les auteurs rapportent un "taux de succès élevé" et un "temps d'interaction faible" lors des évaluations expérimentales, sans publier de métriques chiffrées précises dans le résumé, ce qui limitera la comparabilité directe avec d'autres systèmes.

L'enjeu de FAM-HRI dépasse la performance brute : le système cible explicitement les utilisateurs souffrant de handicaps moteurs ou de mobilité réduite, une population pour laquelle les interfaces gestuelles classiques sont inutilisables et les commandes vocales seules insuffisamment précises pour la manipulation spatiale. En fusionnant regard et parole au niveau sémantique via un LLM, l'architecture évite les ambiguïtés typiques des commandes monocanal, comme "prends l'objet" sans désignation claire. C'est un pas concret vers des robots d'assistance utilisables en conditions réelles, où la robustesse à l'imprécision humaine prime sur la performance en environnement contrôlé.

La combinaison regard-parole pour le contrôle robotique n'est pas nouvelle, mais l'intégration de LLMs pour la fusion contextuelle représente une évolution récente, rendue possible par la réduction des coûts d'inférence. Les lunettes Meta ARIA, conçues initialement pour la recherche en réalité augmentée, trouvent ici une application robotique directe. Les concurrents dans l'espace HRI multimodal incluent des travaux issus de CMU, ETH Zurich et d'équipes japonaises comme Preferred Networks et l'AIST. L'ensemble du code et des algorithmes est publié en open source sur GitHub, ce qui facilitera la reproductibilité. Les prochaines étapes naturelles seraient une validation en conditions cliniques ou à domicile, et une extension à des plateformes mobiles au-delà de la manipulation fixe.

Dans nos dossiers

À lire aussi

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation
1arXiv cs.RO 

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation

Une étude soumise en mai 2025 sur arXiv (référence 2605.00963) présente une analyse par ablation d'un système de manipulation robotique piloté par interaction homme-robot multimodale, appliqué à une tâche de détection et saisie d'objets. Les chercheurs ont ciblé trois modules du pipeline : le modèle de langage chargé d'extraire les actions à partir d'instructions verbales, le système de perception assurant l'ancrage visuel des objets cibles, et le contrôleur gérant l'exécution du mouvement. L'étude compare trois LLM distincts, cinq configurations de perception, et trois contrôleurs, avant de soumettre les meilleures combinaisons à une analyse factorielle croisée en seconde phase. L'objectif déclaré n'est pas de redessiner le pipeline, mais d'isoler la contribution de chaque composant sous un protocole expérimental commun. Cette approche répond à une question directement actionnable pour les intégrateurs et ingénieurs robotiques : quel module optimiser en priorité pour améliorer le taux de succès, et lequel pour réduire le temps d'exécution ? Dans un contexte industriel, ces deux métriques obéissent à des contraintes distinctes selon les postes de travail, et les confondre dans une évaluation globale masque les vrais leviers d'amélioration. La méthodologie par ablation reste encore rare dans les publications de manipulation robotique, où la tendance est d'évaluer un seul composant à la fois, ce qui rend les résultats difficiles à reproduire ou à transposer d'un système à l'autre. Les auteurs précisent que l'analyse vise aussi à orienter les choix d'ingénierie dans les prochaines versions du système. Ce travail s'inscrit dans un effort plus large de la communauté pour rendre opérationnels les pipelines de manipulation guidés par langage hors des environnements contrôlés de laboratoire. Sur le plan concurrentiel, deux écoles s'affrontent actuellement : les modèles unifiés de type VLA (Vision-Language-Action) entraînés à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, et les pipelines modulaires qui préservent la séparabilité des composants pour faciliter le débogage et l'adaptation sectorielle. L'étude n'annonce pas de déploiement industriel et reste pour l'instant au stade de la validation expérimentale. La prochaine étape logique serait de tester si les gains mesurés en laboratoire résistent au sim-to-real gap, qui demeure le principal obstacle à la mise en production des systèmes de manipulation guidés par instructions en langage naturel.

RecherchePaper
1 source
Interaction et compagnonnage pilotés par modèle de langage multimodal pour robots de service en maison de retraite
2arXiv cs.RO 

Interaction et compagnonnage pilotés par modèle de langage multimodal pour robots de service en maison de retraite

Des chercheurs présentent un système de robot compagnon destiné aux établissements de soins pour personnes âgées, décrit dans un article publié le 25 août 2026 sur arXiv (arXiv:2608.21387v1). Le système combine trois couches fonctionnelles : une couche de perception assurant le suivi visuel actif de la personne via un gimbal motorisé qui maintient l'utilisateur dans le champ de vision malgré les occlusions ou mouvements brusques, une couche d'interaction pilotée par un grand modèle de langage (LLM) qui interprète les requêtes vocales et les traduit en actions robotiques comme l'escorte ou la navigation sémantique, et un agent de sécurité basé sur un modèle vision-langage (VLM) qui analyse en continu les images pour détecter les chutes et postures anormales et déclencher des alertes d'urgence. Les auteurs rapportent des résultats expérimentaux montrant un suivi et une interaction fiables avec des humains, ainsi qu'une détection efficace des chutes potentielles. L'article ne précise ni le matériel robotique utilisé, ni les modèles LLM/VLM spécifiques déployés, ni de volumes de test chiffrés. Cette publication illustre une tendance de fond dans la robotique de service : l'intégration de plusieurs briques technologiques distinctes, initialement traitées séparément dans la littérature, en un système unifié combinant navigation, dialogue naturel et surveillance de sécurité. Pour les intégrateurs et décideurs du secteur médico-social, cela répond à un besoin concret d'allègement de la charge des aidants tout en maintenant une surveillance continue, un enjeu critique face au vieillissement démographique et à la pénurie de personnel soignant dans les maisons de retraite. L'approche confirme aussi la viabilité croissante des architectures VLA (vision-langage-action) et VLM pour des tâches de sécurité en temps réel, au-delà des simples démonstrations de laboratoire, même si l'absence de détails sur le taux de faux positifs ou la robustesse en conditions réelles d'EHPAD appelle à la prudence. Ce travail s'inscrit dans un courant de recherche plus large sur les robots sociaux d'assistance, où la plupart des systèmes existants se limitent à des fonctions isolées comme la téléprésence ou le rappel de médicaments, sans capacité de compagnonnage continu. Les auteurs positionnent explicitement leur contribution comme comblant ce manque d'intégration entre suivi humain, interaction naturelle et sécurité. L'article ne mentionne pas de partenariat industriel, de nom de plateforme robotique commerciale, ni de calendrier de déploiement pilote en établissement réel, suggérant un stade encore préliminaire, proche de la preuve de concept académique plutôt que d'un produit prêt à être industrialisé.

RecherchePaper
1 source
Modèle de cognition du monde pour l'interaction humain-robot généralisable
3arXiv cs.RO 

Modèle de cognition du monde pour l'interaction humain-robot généralisable

Un article scientifique publié sur arXiv (référence 2607.22999v1) présente WCM, pour World-Cognition Model, un agent robotique conçu pour rendre l'interaction homme-robot aussi fluide que celle qu'offrent déjà les agents conversationnels dans le logiciel. Le système repose sur une architecture baptisée SLAK, acronyme de Sensing, Logic, Action et Knowledge, qui sépare explicitement la perception, le raisonnement, le contrôle moteur et la mémoire. Cette séparation s'appuie sur un runtime asynchrone permettant au raisonnement, au dialogue et à l'exécution de se dérouler en parallèle plutôt que séquentiellement. WCM ajoute un mode d'apprentissage supervisé par l'humain, où l'utilisateur peut enseigner interactivement au robot des tâches longues ou complexes ; ces épisodes d'enseignement, combinés aux exécutions autonomes, sont ensuite convertis en données de supervision par chaîne de raisonnement (chain-of-thought) pour affiner le modèle en continu. Sur neuf tâches réelles d'interaction homme-robot, le système atteint un taux de réussite moyen de 73,8 %, y compris sur des tâches exclues de l'entraînement par chaîne de raisonnement et sur une tâche longue apprise uniquement par démonstration humaine. L'enjeu dépassé ici n'est pas tant la performance brute que la question de la contrôlabilité. Les approches dominantes actuelles, qu'il s'agisse des politiques vision-langage-action (VLA) ou des planificateurs fondés sur des modèles du monde, sont optimisées pour exécuter une instruction, mais laissent peu de visibilité à l'utilisateur sur les raisons d'une action donnée et peu de moyens de corriger ou réorienter le robot en cours de tâche. En proposant un mécanisme explicite de correction et d'enseignement en temps réel, WCM répond à un point de friction identifié par les intégrateurs industriels : un robot qui exécute bien mais s'explique mal reste difficile à déployer et à faire confiance sur des tâches non anticipées. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles de fondation pour la robotique, où des architectures comme les VLA ont cherché à généraliser l'exécution de tâches à partir de démonstrations massives. WCM se positionne en complément plutôt qu'en rupture, en ajoutant une couche cognitive et interactive au-dessus du contrôle bas niveau. Les auteurs ne précisent pas de calendrier de déploiement industriel ni de partenaire commercial ; il s'agit à ce stade d'une publication de recherche, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et de plateformes robotiques.

RecherchePaper
1 source
Glance-Say : collaboration homme-robot multimodale et reconnaissance d'intention via un regard soutenu
4arXiv cs.RO 

Glance-Say : collaboration homme-robot multimodale et reconnaissance d'intention via un regard soutenu

Des chercheurs proposent Glance-Say, un cadre d'interaction multimodale associant regard et parole pour la manipulation robotique assistive destinee aux personnes a mobilité réduite. Le système repose sur un algorithme dit de "regard collant" (sticky-glance) qui stabilise la sélection de cible en cumulant conjointement la distance géométrique et l'évidence directionnelle du regard, un mécanisme conçu pour compenser les micro-saccades oculaires et l'ambiguïté sémantique dans des environnements comportant plusieurs objets. Dans ce paradigme, le regard désigne l'objet vise pendant que la commande vocale précise l'action a exécuter, le tout couple a un schéma de contrôle partage en continu qui maintient le bras robotique en état de haute réactivité tout en intégrant un retour humain-dans-la-boucle. Les expériences rapportées affichent un taux de suivi de 0,92 pour des cibles mobiles, une précision de sélection de 0,97 pour des cibles statiques, ainsi qu'une réduction du temps nécessaire pour accomplir les taches, par rapport aux paradigmes d'interaction de référence. Pour l'assistance robotique aux personnes en situation de handicap moteur, ce travail s'attaque a un verrou concret: les interfaces regard-plus-voix existantes échouent souvent des que plusieurs objets similaires sont présents ou que l'utilisateur bouge la tête, forçant des ré-sélections fastidieuses. Une méthode qui stabilise l'intention en temps réel sans capteur exotique, en s'appuyant sur des signaux de regard et de parole standards, rapproche ce type d'interface d'un usage quotidien réaliste plutôt que d'une démonstration de laboratoire en conditions idéales. Pour les intégrateurs travaillant sur des bras assistifs ou des fauteuils robotises, cela ouvre la voie a des contrôles plus naturels, sans dispositifs de pointage dédiés ni entrainement lourd de l'utilisateur. Ce travail s'inscrit dans la lignée des recherches en interaction cerveau-machine et interfaces oculaires pour l'assistance, un champ historiquement freine par le bruit du regard et l'ambiguïté des commandes vocales isolées. Publie sur arXiv en tant que version révisée, l'article ne mentionne pas de partenariat industriel ni de déploiement au-delà du banc d'essai expérimental; les prochaines étapes attendues concernent une validation sur davantage d'utilisateurs et de scenarios de manipulation réels, ainsi qu'une comparaison plus large face aux systèmes commerciaux d'assistance existants.

RecherchePaper
1 source