Vers une récupération des échecs robotiques supervisée par l'humain : combler les lacunes de communication en collaboration homme-robot
Une équipe de recherche présente LD-HRI (Listener Differences in Human-Robot Interaction), un jeu, un jeu de données et un benchmark publiés sur arXiv (2609.24055v1), pour évaluer les demandes d'aide qu'un robot adresse à un passant quand il échoue sur une tâche. Le constat : les méthodes de génération de requêtes dites "inverse semantics" n'avaient jusqu'ici été testées qu'avec un seul modèle d'auditeur, sans jamais faire varier son niveau réel de connaissance. Le corpus rassemble 446 requêtes écrites par des humains, évaluées sur 1302 essais, plus 24 requêtes générées par des grands modèles de langage (LLM), testées auprès de 70 auditeurs humains sur 560 essais répartis en quatre tâches. Les novices réussissent descriptivement mieux avec les requêtes générées par IA, mais un écart expert-novice subsiste, atteignant 16 points de pourcentage pour les requêtes LLM.
Ce résultat nuance l'idée que les LLM auraient déjà résolu la communication homme-robot en cas d'échec : produire une phrase compréhensible ne suffit pas à combler l'écart entre auditeur expert et novice, un enjeu critique pour tout robot de service ou humanoïde déployé hors laboratoire et amené à solliciter des passants sans formation. Pour les intégrateurs qui misent sur des architectures VLA (vision-language-action) pour gérer les échecs en environnement réel, LD-HRI offre un cadre de test reproductible, chiffrant précisément où la communication échoue selon le public visé. La formulation "descriptivement plus élevé" appelle toutefois la prudence : elle suggère un effet observé sans garantie de significativité statistique forte, sur un échantillon de seulement 70 auditeurs.
LD-HRI s'inscrit dans la lignée des travaux d'"inverse semantics", qui génèrent des requêtes de robot en simulant comment un auditeur les interpréterait, jusqu'ici validés sur un seul modèle plutôt que sur des humains aux connaissances variées. En mesurant la performance réelle d'auditeurs classés par niveau d'expertise, l'équipe comble un vide méthodologique fréquent en interaction homme-robot, où la démonstration de faisabilité prime souvent sur la mesure d'écart entre utilisateurs. Aucun acteur commercial ni robot physique n'est nommé : il s'agit d'une contribution de recherche, pas d'une annonce produit. Les auteurs présentent LD-HRI comme une fondation destinée à guider la conception de futurs systèmes de communication homme-robot plus robustes, dataset et benchmark à l'appui pour de futures comparaisons entre générateurs de requêtes.
Dans nos dossiers




