Aller au contenu principal
RecherchearXiv cs.RO 

RoboCafé en public : la continuité d'interaction dans une relation homme-robot de longue durée en lieu public

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un robot conversationnel autonome baptisé RoboCafé a été déployé pendant 12 jours dans un bâtiment universitaire, où il a reçu 148 commandes de café. Conçu pour étudier la continuité d'interaction dans les interactions homme-robot publiques de longue durée, le système combine un dialogue orienté tâche, une perception multimodale en temps réel et une mémoire des rencontres précédentes, lui permettant en théorie de reconnaître des clients récurrents et d'adapter son comportement au contexte accumulé. Le déploiement a exposé le robot à une diversité de situations réelles : clients réguliers revenant plusieurs fois, simples passants, groupes de personnes changeants, et commandes s'enchaînant sans interruption nette entre elles. Ces situations ont systématiquement mis à l'épreuve, et souvent dépassé, les limites du modèle d'interaction centré sur la commande individuelle que les concepteurs avaient initialement prévu.

L'intérêt de cette étude dépasse le simple cas d'usage du café automatisé : elle documente empiriquement l'écart entre les hypothèses de conception habituelles des systèmes conversationnels robotiques, pensés autour d'échanges isolés et bien délimités, et la réalité fragmentée des espaces publics, où les interactions se chevauchent, se reprennent ou changent d'interlocuteur sans avertissement. Pour les concepteurs de robots de service et les intégrateurs visant des déploiements prolongés en environnement ouvert (accueil, commerce, espaces de travail), ce constat souligne qu'une architecture de dialogue fonctionnelle en démonstration contrôlée peut échouer silencieusement dès qu'elle rencontre la variabilité du monde réel, notamment sur la question de savoir qui est présent, à qui appartient quel contexte, et où commence ou finit réellement une interaction.

À partir de ces observations tirées du terrain, les chercheurs formulent quatre exigences de conception pour maintenir la continuité d'interaction dans des déploiements publics longitudinaux : un état d'interaction contextuel, un ancrage persistant des personnes identifiées, une gestion explicite du cycle de vie de chaque interaction, et une observabilité permettant de vérifier que la représentation interne du robot correspond à ce qui se passe réellement dans le monde physique. L'étude, publiée sur arXiv fin septembre 2026, se positionne comme un travail de recherche en interaction homme-robot plutôt qu'une annonce produit, et propose ces quatre principes comme base pour de futurs systèmes conversationnels robotiques destinés à des usages publics de longue durée.

Dans nos dossiers

À lire aussi

Évaluation multimodale en ligne de la charge de travail dans l'interaction physique homme-robot à contact riche
1arXiv cs.RO 

Évaluation multimodale en ligne de la charge de travail dans l'interaction physique homme-robot à contact riche

Une équipe de recherche publie sur arXiv (référence 2609.18031, soumission de type "new") un cadre d'évaluation en ligne de la charge de travail dans les interactions physiques homme-robot riches en contact, un domaine qui couvre par exemple l'assemblage collaboratif ou la manipulation partagée avec un cobot. Le système combine trois signaux capturés en continu, le torseur d'effort au point de contact, la cinématique planaire du point central de l'outil (TCP), et la conductance cutanée (SCL), qu'il synthétise en quatre facteurs interprétables liés à la charge de travail. Les poids de ces facteurs sont ajustés dynamiquement selon la courbure de la trajectoire, pour refléter les variations de la demande motrice, et selon la progression de la tâche, pour tenir compte de la dérive physiologique dans le temps. Le protocole d'évaluation a mobilisé 24 participants soumis à 18 combinaisons contrôlées de température, de bruit acoustique et d'éclairement, testées sous deux modes de commande en admittance. En validation croisée stricte de type "un sujet exclu" (LOSO), avec le diamètre pupillaire standardisé comme référence physiologique indépendante, le cadre atteint une corrélation de Spearman moyenne de 0,308 sur des blocs de 30 secondes, avec une corrélation positive chez 23 des 24 participants. Pour les intégrateurs de cobots et les concepteurs de commandes en admittance, l'intérêt tient moins à la performance brute, une corrélation de 0,308 reste modeste, qu'à la transparence de la méthode : elle égale des modèles d'apprentissage profond "boîte noire" tout en gardant des facteurs de charge explicites et des règles de pondération définies, ce qui facilite l'audit et la certification en environnement industriel. Elle ouvre la voie à une adaptation en temps réel des paramètres de contrôle robotique en fonction de l'état physiologique de l'opérateur, sans dépendre uniquement d'un dispositif de suivi pupillaire coûteux et contraignant. Ce travail s'inscrit dans la recherche sur l'évaluation continue de la charge cognitive et physique en pHRI, en alternative aux questionnaires post-tâche classiques et aux approches à poids fixes, jugées moins robustes. Étant un préprint tout juste annoncé, il n'a pas encore été validé par les pairs ni testé en conditions industrielles réelles, et ses auteurs comparent leur approche à des références d'apprentissage automatique jugées représentatives de l'état de l'art sans toutefois les nommer précisément.

RecherchePaper
1 source
Conversation homme-robot avec plusieurs interlocuteurs dans des espaces publics bruyants
2arXiv cs.RO 

Conversation homme-robot avec plusieurs interlocuteurs dans des espaces publics bruyants

À l'occasion de l'Exposition universelle 2025 d'Osaka, une équipe de recherche a présenté en démonstration un système audio conçu pour permettre à des robots et des avatars de dialoguer avec plusieurs interlocuteurs à la fois dans des espaces publics bruyants, selon un article publié sur arXiv (2609.00648v1). Deux scénarios ont été testés en conditions réelles. Le premier repose sur l'android ERICA, conçu comme un système d'écoute attentive capable de suivre une conversation avec plusieurs personnes simultanément. Le second met en jeu des robots mobiles baptisés Teleco, dont l'un sert d'avatar télécommandé par un opérateur humain à distance pour assister la conversation. Les deux dispositifs s'appuient sur un unique réseau de microphones multicanal, qui capte et sépare la parole de plusieurs locuteurs dans un environnement bruyant, plutôt que sur des architectures multi-capteurs complexes. Cette démonstration s'attaque à un point faible récurrent de l'interaction homme-robot conversationnelle : la plupart des systèmes de dialogue vocal sont mis au point en laboratoire, dans des conditions acoustiques contrôlées, et perdent en fiabilité dès qu'ils affrontent le bruit ambiant d'un lieu public fréquenté. Réussir à extraire une parole exploitable, que ce soit pour la reconnaissance vocale embarquée ou pour la retransmettre proprement à un opérateur distant, est une condition pratique pour déployer des robots d'accueil ou des avatars de téléprésence dans des halls d'exposition, aéroports ou espaces commerciaux. L'ajout d'une restitution en audio spatial pour l'opérateur distant vise aussi à renforcer son sentiment de présence, un enjeu clé pour les usages de téléprésence robotique. Le fait qu'une seule antenne micro suffise pour les deux cas d'usage est également un argument de simplicité et de coût pour d'éventuels intégrateurs. ERICA est un android développé de longue date par les équipes de recherche japonaises en interaction homme-robot, régulièrement utilisé comme plateforme d'expérimentation pour des conversations naturelles avec des humains. Les robots Teleco, eux, sont pensés comme des plateformes mobiles de téléprésence. L'Exposition universelle d'Osaka a servi de terrain d'essai grandeur nature, exposant les deux systèmes à un bruit de foule impossible à reproduire en laboratoire. Il s'agit à ce stade d'une preuve de concept scientifique, sans annonce de produit commercial, de pilote industriel ni de calendrier de déploiement.

RecherchePaper
1 source
IA en Réalité étendue : une couche de médiation pour le contrôle humain situé dans la collaboration homme-robot
3arXiv cs.RO 

IA en Réalité étendue : une couche de médiation pour le contrôle humain situé dans la collaboration homme-robot

Des chercheurs proposent, dans un article publié sur arXiv (2607.25047v1, catégorie cross-listing), un cadre conceptuel pour repenser le rôle de la réalité étendue (XR) dans la collaboration homme-robot. Plutôt que de limiter la XR à l'affichage d'intentions ou de trajectoires planifiées, les auteurs avancent qu'elle doit devenir une véritable couche de médiation pour ce qu'ils nomment le "contrôle humain situé" : la capacité d'un opérateur à comprendre, orienter, autoriser ou interrompre l'action d'un robot dans le contexte physique, social et temporel précis où elle se déroule. Le raisonnement s'appuie sur trois scénarios concrets : l'assistance robotique au chevet de patients en soins infirmiers, la supervision de bras robotiques multiples, et l'assemblage collaboratif sous attention divisée. À partir de ces cas, l'équipe identifie quatre fonctions de médiation (entre intention humaine et autonomie du robot, entre plans du robot et jugement humain, entre niveaux de contrôle partagé, et entre rôles d'équipe, passations et récupération d'erreurs), puis en déduit six dimensions de conception : possibilités d'action conjointe, contraintes socio-physiques, gestion de l'incertitude et de la validité des plans, contrôle et correction multimodaux, répartition des rôles avec traçabilité, et anticipation de la récupération après incident. L'enjeu dépasse la simple interface homme-machine. Dans les environnements industriels ou de soin où les robots gagnent en autonomie, le déficit d'inspectabilité reste un frein majeur à l'adoption : un opérateur qui ne peut pas anticiper ni corriger une décision robotique en temps réel perd la confiance nécessaire à une collaboration fluide, surtout quand les objectifs changent, que la perception du robot est incomplète, ou que les rôles entre humain et machine évoluent en cours de tâche. Ce travail rappelle que la robustesse d'un système collaboratif ne se joue pas seulement dans l'algorithme de planification, mais dans la capacité de l'humain à rester "dans la boucle" de façon actionnable, un enjeu direct pour les intégrateurs qui déploient des cobots ou des systèmes supervisés en environnement partagé. Il s'agit ici d'un article de position et non d'un système déployé ou d'un produit commercialisé : aucun prototype XR complet n'est présenté, l'apport est une grille d'analyse destinée à orienter la recherche future. Le texte s'inscrit dans la continuité des travaux sur le contrôle partagé et l'autonomie ajustable en robotique collaborative, et propose un agenda de recherche pour concevoir des systèmes XR qui rendraient l'autonomie robotique plus lisible et plus redevable dans des environnements dynamiques, sans préciser à ce stade de calendrier ni de partenaires industriels associés.

RecherchePaper
1 source
HRIBench : évaluation de la collaboration homme-robot centrée sur l'interaction
4arXiv cs.RO 

HRIBench : évaluation de la collaboration homme-robot centrée sur l'interaction

Ce papier arXiv (2607.13056v1) présente HRIBench, un benchmark diagnostique conçu pour évaluer la collaboration homme-robot centrée sur l'interaction, plutôt que la seule manipulation isolée. Contrairement aux benchmarks VLA (vision-language-action) existants, qui testent des compétences de manipulation déconnectées de toute interaction humaine, HRIBench modélise les tâches collaboratives sous forme de scénarios structurés intégrant rôles des agents, dépendances temporelles, contraintes de coordination et distributions de comportement humain. Trois rôles sont définis : Instructeur, Collaborateur et Intrus, couvrant respectivement la communication d'intention, la coordination conjointe et la robustesse face à une intervention humaine imprévue. Le benchmark comprend 13 tâches conditionnées par rôle et plus de 650 épisodes d'évaluation générés à partir de trajectoires d'interaction et de variations de scène diverses. Les chercheurs ont testé des politiques adaptées à partir de GR00T, pi0.5 et ACT selon un protocole unifié, avec des métriques allant au-delà du simple taux de réussite : synchronisation, réactivité, respect du protocole et sécurité. Les résultats montrent que les politiques robotiques actuelles, malgré de bonnes capacités de manipulation pure, peinent nettement dès qu'il s'agit de coordination temporelle et de comportement sensible à l'intention humaine, un angle mort largement ignoré par les benchmarks existants. Ce constat vient nuancer l'idée que les modèles VLA généralistes seraient déjà prêts pour une collaboration homme-robot fluide en environnement partagé, un enjeu central pour tout déploiement industriel où humains et robots opèrent côte à côte. Fait notable, un fine-tuning sur les données HRIBench améliore systématiquement les performances collaboratives, et en conditions réelles, les données de simulation générées par le benchmark font passer le taux de réussite de GR00T N1.5 sur une tâche physique de 0,10 à 0,43. HRIBench s'inscrit dans une dynamique de recherche cherchant à combler l'écart entre benchmarks de manipulation pure et exigences réelles de la cohabitation homme-robot, à mesure que des politiques comme GR00T (NVIDIA), pi0.5 (Physical Intelligence) ou ACT gagnent en usage comme bases pour l'apprentissage robotique généraliste. Les auteurs positionnent leur travail comme un outil diagnostique réutilisable, avec des pistes explicites de fine-tuning ciblé pour renforcer la coordination et la sécurité, plutôt qu'un simple classement de performances brutes.

RecherchePaper
1 source