Aller au contenu principal
Assistance sans interruption : un benchmark et un cadre basé sur les LLM pour l'aide humain-robot non intrusive
RecherchearXiv cs.RO 

Assistance sans interruption : un benchmark et un cadre basé sur les LLM pour l'aide humain-robot non intrusive

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.01368) un cadre formel et un benchmark dédié à l'assistance robotique non intrusive, qu'ils nomment NIABench. Le problème étudié est précis : comment un robot peut-il soutenir un humain en train d'exécuter une séquence d'actions complexes, sans jamais l'interrompre ni attendre une commande explicite ? Les chercheurs proposent également une architecture hybride combinant un grand modèle de langage (LLM) et un modèle de scoring à deux étages : une première couche de récupération sémantique réduit l'espace des actions candidates, puis un module de ranking évalue les paires (étape humaine, action robot) pour arbitrer sur le moment et la nature de l'intervention. Les expériences sont conduites sur NIABench et validées sur des scénarios réels, avec des métriques inédites adaptées à ce paradigme.

Ce travail est significatif parce qu'il déplace le curseur de la robotique collaborative vers un mode opératoire radicalement différent : le plan humain devient le processus principal, et le robot se positionne en assistant discret plutôt qu'en agent concurrent. Pour les intégrateurs de robots de service ou de cobots industriels, cela ouvre une voie concrète vers des déploiements où le robot n'exige ni formation de l'opérateur, ni protocole de communication explicite. La formalisation du problème joint, décider simultanément du quand et du quoi, est également un apport méthodologique, car la littérature HRI traitait jusqu'ici ces deux dimensions séparément. La présence d'un benchmark public avec métriques standardisées facilite la comparaison future entre approches.

Ce travail s'inscrit dans un courant de recherche HRI qui cherche à dépasser les modèles maître-esclave ou les systèmes à déclenchement explicite. Des approches concurrentes, notamment dans les travaux sur les VLA (Vision-Language-Action models) de DeepMind ou Stanford, adressent la réactivité contextuelle mais sans formaliser explicitement la contrainte de non-intrusion. NIABench pourrait devenir un point de référence pour évaluer ces modèles sur cette dimension précise. Les prochaines étapes naturelles incluent le transfert vers des plateformes embarquées et des tests en environnements industriels réels, bien qu'aucun partenariat ou calendrier de déploiement ne soit mentionné dans cette publication.

Dans nos dossiers

À lire aussi

Assistant IA conversationnelle basée sur un LLM pour le robot humanoïde MyBuddy
1arXiv cs.RO 

Assistant IA conversationnelle basée sur un LLM pour le robot humanoïde MyBuddy

Une équipe de recherche présente, dans un preprint publié en septembre 2026 sur arXiv sous la référence 2609.24742, un assistant conversationnel basé sur des grands modèles de langage (LLM) intégré au robot humanoïde MyBuddy, une plateforme compacte à deux bras et 13 axes, pilotée par un Raspberry Pi et commercialisée par le fabricant chinois Elephant Robotics, connu pour ses bras robotiques éducatifs. Le système associe reconnaissance vocale en temps réel, compréhension du langage naturel et raisonnement via LLM, récupération de connaissances en ligne auprès de sources ouvertes comme Wikipedia et arXiv, gestion flexible du dialogue multi-tours et synthèse vocale naturelle. L'objectif affiché est de remplacer les dialogues à base de règles et de réponses prédéfinies, jusque là dominants sur ce type de plateforme, par des échanges continus et un accompagnement à caractère émotionnel dans l'interaction humain-robot. Ce travail illustre une tendance de fond dans la robotique humanoïde : l'usage des LLM ne se limite plus au contrôle moteur ou à la planification de tâches, comme dans les architectures vision-langage-action de type Pi-0 ou GR00T N2, il gagne aussi la couche conversationnelle et sociale des robots destinés à l'assistance aux personnes. Pour les intégrateurs et concepteurs de robots de service, la démonstration suggère qu'il est possible de dépasser les bases de connaissances fermées en connectant un robot à des moteurs de recherche externes pour répondre à des questions arbitraires, un enjeu clé pour l'accueil, l'éducation ou l'accompagnement de personnes âgées. Le travail reste toutefois un prototype de recherche en preprint, sans évaluation par les pairs ni benchmarks chiffrés sur la latence, le taux d'erreur de reconnaissance vocale ou la satisfaction des utilisateurs, ce qui invite à la prudence avant toute extrapolation vers un usage en production. MyBuddy est une plateforme robotique peu coûteuse, déjà utilisée dans plusieurs laboratoires universitaires pour la recherche en interaction humain-robot, ce qui en fait un support de prototypage logiciel courant plutôt qu'un produit commercial à grande échelle comparable à l'Optimus Gen 3 de Tesla ou au G1 d'Unitree. Le champ de l'assistance conversationnelle embarquée compte déjà plusieurs approches concurrentes, des architectures orientées action physique comme Helix de Figure jusqu'à des chatbots embarqués plus simples sur robots grand public. Les auteurs ne mentionnent ni calendrier de déploiement pilote ni partenariat industriel ; la suite logique de ce type de travail académique passe généralement par une évaluation utilisateur plus poussée et une soumission à une conférence spécialisée en interaction humain-robot.

RecherchePaper
1 source
Cadre de détection et reconnaissance des interactions humain-humain pour robots mobiles de service
2arXiv cs.RO 

Cadre de détection et reconnaissance des interactions humain-humain pour robots mobiles de service

Des chercheurs ont publié sur arXiv (référence 2602.22346) un framework de perception sociale destiné aux robots de service mobiles autonomes, comme les robots tondeuses ou les robots nettoyeurs opérant dans des espaces fréquentés par des humains. Le système repose sur une architecture en deux étapes : une première phase identifie les paires d'individus susceptibles d'interagir en s'appuyant uniquement sur des indices géométriques et de mouvement (positions relatives, trajectoires, orientations corporelles), puis une seconde phase classe le type d'interaction à l'aide d'un réseau relationnel (relation network). L'approche a été évaluée sur le dataset JRDB, benchmark de référence pour la perception sociale en robotique, ainsi que sur le Collective Activity Dataset (CAD) et, en évaluation zero-shot, sur un jeu de données collecté directement par une tondeuse autonome en conditions réelles. L'enjeu est concret pour les intégrateurs de robots de service : détecter qu'un groupe de personnes interagit entre elles, qu'il s'agisse d'une discussion, d'un attroupement ou d'une interaction dynamique, permet au robot de planifier une trajectoire socialement acceptable sans interrompre ni gêner ces échanges. Les approches existantes reposent souvent sur des modèles de reconnaissance d'activité de groupe qui mobilisent des réseaux d'analyse visuelle coûteux en calcul, inadaptés aux plateformes embarquées à ressources limitées. Ce framework démontre que des indices géométriques simples suffisent à obtenir des performances compétitives tout en réduisant significativement la taille du modèle et le coût computationnel. Ce résultat remet en question l'hypothèse largement répandue selon laquelle l'analyse visuelle par apparence serait indispensable pour ce type de tâche de perception sociale. Ce travail s'inscrit dans le champ de la navigation socialement consciente (socially aware navigation), où des frameworks comme SARL, CrowdNav ou ORCA constituent les références historiques. Le dataset JRDB, produit par Stanford, reste le principal benchmark pour ce type de tâche en environnement robotique réel. Le code est publié en open source, ce qui facilitera son intégration dans des pipelines ROS existants. La limite notable est que l'évaluation porte sur des interactions coarse-grained, c'est-à-dire des catégories comportementales larges plutôt que des gestes fins, ce qui suffit pour la navigation mais exclut les applications nécessitant une compréhension sociale plus granulaire. La prochaine étape naturelle serait une validation à plus grande échelle sur des plateformes réelles déployées en environnements semi-publics, comme des aéroports, des centres commerciaux ou des entrepôts à occupation mixte.

RecherchePaper
1 source
PACT : une approche proactive pour l'assistance continue aux tâches en collaboration humain-robot
3arXiv cs.RO 

PACT : une approche proactive pour l'assistance continue aux tâches en collaboration humain-robot

Des chercheurs ont publié PACT (Proactive Asking for Continual Task Assistance), un framework de collaboration humain-robot sur la durée, soumis sur arXiv en mai 2026 (arXiv:2605.24350). Le problème posé est concret : un assistant robotique déployé sur plusieurs jours ignore initialement les habitudes et préférences de son utilisateur, rendant l'inférence passive peu fiable dès les premières interactions. PACT propose une logique "ask-or-act" : plutôt que d'agir sans certitude, le robot décide à chaque instant s'il doit demander une clarification ou exécuter directement la tâche. Le système combine les observations courantes avec un historique d'interactions multi-jours pour évaluer la suffisance contextuelle avant d'agir. L'implémentation principale repose sur du reinforcement learning, et les auteurs introduisent une nouvelle métrique, la "clarification utility", qui mesure le compromis entre précision de l'assistance et fréquence des interruptions imposées à l'utilisateur. Ce framework répond à un déficit structurel des robots d'assistance actuels : en inférant silencieusement, un robot avec un modèle utilisateur incomplet accumule les erreurs et dégrade rapidement la confiance opérationnelle. PACT inverse la logique -- le robot reconnaît son incertitude et l'exprime plutôt que de la masquer. Pour les intégrateurs envisageant des robots en assistance à domicile, en co-robotique de bureau ou en environnement industriel léger, cette approche réduit la nécessité d'une modélisation préalable exhaustive des préférences utilisateur. Les expériences en scénarios multi-jours montrent des gains consistants en précision et en utilité des clarifications face aux baselines d'inférence passive, bien que la validation sur plateforme matérielle réelle reste à démontrer. Le défi de l'adaptation continue en collaboration humain-robot est partagé par plusieurs axes de recherche actifs, dont les benchmarks domestiques ALFRED et les travaux de personnalisation menés chez Figure, 1X ou Boston Dynamics pour leurs robots humanoïdes. Des équipes européennes -- INRIA, TU Delft -- explorent également ces mécanismes d'apprentissage en contexte prolongé. PACT se distingue en traitant l'incertitude épistémique par le dialogue explicite plutôt que par des mécanismes d'inférence silencieux, une approche complémentaire aux méthodes VLA (Vision-Language-Action) actuellement dominantes. La publication reste un preprint sans validation industrielle annoncée ; l'étape critique sera de quantifier le coût cognitif réel des clarifications répétées pour l'utilisateur dans des contextes de travail prolongés.

UEDes équipes européennes dont l'INRIA (France) et TU Delft (Pays-Bas) travaillent sur des mécanismes similaires d'apprentissage contextuel prolongé, ce qui positionne PACT comme référence pertinente pour la communauté HRI européenne, sans impact industriel direct à ce stade.

RecherchePaper
1 source
CoViLLM : un cadre collaboratif adaptatif humain-robot pour l'assemblage, basé sur des grands modèles de langage
4arXiv cs.RO 

CoViLLM : un cadre collaboratif adaptatif humain-robot pour l'assemblage, basé sur des grands modèles de langage

Des chercheurs présentent CoViLLM, un framework de collaboration homme-robot pour l'assemblage adaptatif, décrit dans une prépublication arXiv (2603.11461v3, version révisée). Le système combine trois briques : une localisation d'objets par caméra de profondeur pour estimer la position des pièces, une classification opérée par l'humain pour identifier les composants nouveaux ou non répertoriés, et un grand modèle de langage chargé de générer les plans de tâches d'assemblage à partir d'instructions en langage naturel. Les auteurs valident leur approche sur le NIST Assembly Task Board, un banc d'essai standardisé de référence pour l'évaluation de systèmes d'assemblage robotique, en testant trois scénarios distincts : produits connus, produits personnalisés, et produits totalement inédits pour le robot. L'enjeu dépassé ici est celui de la rigidité des robots industriels classiques, programmés selon des règles fixes et donc mal adaptés à la personnalisation de masse, un défi central pour les lignes de production modernes. Les frameworks de collaboration homme-robot existants s'appuient généralement sur des pipelines de perception-manipulation prédéfinis, ce qui les empêche de générer eux-mêmes des plans pour assembler un produit jamais vu. CoViLLM prétend lever cette limite en confiant au LLM la planification de tâches à la volée, ce qui, si les résultats se confirment à plus grande échelle, intéresserait directement les intégrateurs et fabricants cherchant à réduire les coûts de reprogrammation lors de changements de variantes produit, un enjeu récurrent dans l'électronique, l'automobile ou les biens de consommation. Les résultats publiés restent toutefois limités à un banc d'essai de laboratoire, et non à une chaîne de production réelle, ce qui appelle à la prudence sur la généralisation immédiate. Ce travail s'inscrit dans la vague de recherches associant modèles de langage et robotique manipulatrice, où les LLM sont de plus en plus testés comme couche de raisonnement au-dessus de pipelines de perception classiques plutôt que comme modèles vision-langage-action de bout en bout. Le choix du NIST Assembly Task Board comme référence permet une comparaison future avec d'autres approches de la communauté robotique académique, sans toutefois indiquer à ce stade de partenariat industriel ou de calendrier de déploiement au-delà du cadre expérimental décrit.

RecherchePaper
1 source