Aller au contenu principal
RecherchearXiv cs.RO 

Estimation du regard pour l'interaction humain-robot : analyse avec la plateforme NICO

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a évalué l'état de l'art de l'estimation du regard (gaze estimation) dans un scénario d'interaction humain-robot en espace de travail partagé. Pour cela, elle a constitué un nouveau jeu de données annoté avec la plateforme robotique NICO, puis comparé quatre modèles d'estimation du regard parmi les plus performants. Les erreurs angulaires obtenues sont proches de celles publiées sur les benchmarks généralistes. Mais converties en distance dans l'espace de travail, la meilleure erreur médiane atteint 14,57 cm. L'étude est publiée sur arXiv (version 3) et se conclut par une discussion de ces limites et des recommandations d'intégration. Le résumé disponible ne précise ni les modèles testés, ni la taille du jeu de données.

Ce résultat a une portée pratique. Dans la littérature, les modèles de regard sont jugés sur leur erreur angulaire, une métrique qui paraît rassurante mais masque l'impact réel : à une distance de travail typique, quelques degrés d'écart se traduisent par plus d'une dizaine de centimètres sur la table. Un robot ne peut donc pas déterminer de façon fiable quel objet, parmi plusieurs pièces proches, un opérateur regarde. Pour les intégrateurs et les responsables d'atelier qui envisagent le regard comme canal de commande ou d'intention dans la collaboration homme-machine, l'étude montre un écart entre les scores de benchmark et l'utilisabilité en situation réelle. Elle suggère de ne pas s'appuyer sur le regard seul. Il faut le combiner à d'autres modalités (geste de pointage, parole, contexte de la tâche) et concevoir des cibles suffisamment espacées.

NICO (Neuro-Inspired COmpanion) est une plateforme humanoïde de recherche développée à l'université de Hambourg, utilisée pour l'interaction sociale et l'apprentissage robotique. Cette étude s'inscrit dans un mouvement plus large visant à mesurer les modèles dans les conditions d'usage, alors que les modèles vision-langage-action (VLA) et les humanoïdes commerciaux misent de plus en plus sur la compréhension des intentions humaines. Il s'agit ici d'un travail académique d'évaluation, sans produit ni déploiement industriel. Les prochaines étapes probables sont l'adaptation des modèles à ce contexte, l'estimation couplée tête-regard et la fusion multimodale.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Gaze4HRI : benchmark zero-shot des réseaux de neurones pour l'estimation du regard en interaction humain-robot
1arXiv cs.RO 

Gaze4HRI : benchmark zero-shot des réseaux de neurones pour l'estimation du regard en interaction humain-robot

Une équipe de chercheurs a publié en mai 2026 Gaze4HRI (arXiv:2605.04770), un benchmark à grande échelle conçu pour évaluer les réseaux de neurones d'estimation du regard dans les conditions réelles de l'interaction humain-robot (HRI). Le jeu de données regroupe plus de 50 sujets, 3 000 vidéos et 600 000 images annotées, couvrant quatre variables critiques identifiées comme sous-représentées dans les évaluations existantes : les variations d'éclairage, les conflits entre direction de la tête et direction du regard, la mobilité de la caméra embarquée sur le robot, et le déplacement de la cible visuelle. L'approche retenue est celle de l'estimation 3D du regard dite "zero-shot" : les modèles apprennent à projeter directement une image RGB en vecteur de regard, sans calibration individuelle, ce qui réduit considérablement les coûts de déploiement en contexte opérationnel. Les résultats du benchmark remettent en question plusieurs hypothèses dominantes dans la littérature. Chacune des méthodes évaluées échoue sur au moins une condition testée, et le regard fortement orienté vers le bas ("steeply-downward gaze") constitue un point d'échec universel pour l'ensemble des architectures, y compris les modèles spatio-temporels complexes et les approches basées sur des Transformers. Ces architectures récentes, pourtant très citées, n'affichent pas de supériorité systématique en conditions non contrôlées. Seul PureGaze, entraîné sur le dataset ETH-X-Gaze, maintient une robustesse satisfaisante sur l'ensemble des autres conditions. La conclusion centrale est que la diversité des données d'entraînement constitue le premier levier de robustesse zero-shot, devant la complexité architecturale, tandis que des mécanismes comme la self-adversarial loss de PureGaze pour la purification des features de regard apportent un gain additionnel significatif. L'estimation du regard est une compétence fondamentale pour les robots sociaux et collaboratifs : elle conditionne la détection d'attention, la coordination tour-par-tour, et la sécurité en environnement partagé. Les benchmarks existants souffrent d'un "complexity gap" structurel, les méthodes étant entraînées sur des corpus variés mais évaluées sur des ensembles beaucoup plus petits et homogènes, ce qui surestime leur robustesse réelle. Gaze4HRI vise à corriger ce biais. Sur le plan concurrentiel, le dataset ETH-X-Gaze (ETH Zurich) s'impose ici comme la référence en termes de diversité, tandis que des benchmarks HRI spécialisés comme GAZE360 ou MPIIFaceGaze ne capturent pas les conditions de mouvement propres aux plateformes robotiques. Le dataset et le code sont disponibles publiquement sur gazeforhri.github.io, ce qui devrait faciliter l'adoption par les équipes travaillant sur des robots humanoïdes ou des AMR équipés de systèmes de perception sociale.

UELe benchmark Gaze4HRI et son dataset public (600 000 images annotées, code ouvert) pourraient accélérer les travaux des équipes européennes comme l'INRIA ou le CEA-List sur la perception sociale des robots collaboratifs et humanoïdes.

RecherchePaper
1 source
OmniRobotHome : une plateforme multi-caméras pour l'interaction humain-robot en temps réel
2arXiv cs.RO 

OmniRobotHome : une plateforme multi-caméras pour l'interaction humain-robot en temps réel

Des chercheurs ont publié en avril 2026 sur arXiv (arXiv:2604.28197) les spécifications d'OmniRobotHome, une plateforme expérimentale résidentielle instrumentée avec 48 caméras RGB synchronisées au niveau matériel pour le suivi 3D temps réel, sans marqueurs, de plusieurs humains et objets simultanément. Le système est couplé à deux bras manipulateurs Franka, qui réagissent à l'état de la scène en temps réel dans un référentiel spatial partagé. La plateforme cible ce que les auteurs nomment la collaboration "multiadique" : plusieurs humains et robots qui partagent un même espace de travail domestique, agissent en parallèle sur des sous-tâches imbriquées avec des contraintes spatiales et temporelles serrées. Contrairement aux setups dyadiques classiques (un humain, un robot, une tâche), OmniRobotHome enregistre en continu pour constituer une mémoire comportementale long-horizon à partir des trajectoires accumulées. Le verrou technique que ce travail prétend lever est l'occlusion persistante : en environnement résidentiel réel, les interactions rapprochées entre humains, robots et objets génèrent des changements d'état rapides et des zones aveugles qui rendent le tracking 3D fiable en temps réel extrêmement difficile. Aucune plateforme existante ne combinait, selon les auteurs, la robustesse aux occlusions à l'échelle d'une pièce entière avec une actuation multi-robots coordonnée. Les deux problèmes ciblés, sécurité en environnement partagé et assistance robotique anticipatoire, montrent des gains mesurables grâce à la perception temps réel et à la mémoire comportementale accumulée, bien que les chiffres précis (taux de collision évités, latence, précision du suivi) ne soient pas détaillés dans l'abstract publié. Ce travail s'inscrit dans une tendance académique vers les plateformes de recherche domestique à grande échelle, aux côtés d'initiatives comme TidyBot (Stanford), HomeRobot (Meta/CMU) ou RoboCasa (UT Austin). L'utilisation de bras Franka, standard de facto en manipulation robotique, facilite la réplication dans d'autres laboratoires. En revanche, la nature preprint de la publication (pas encore soumise à évaluation par les pairs) et l'absence de métriques quantitatives publiées invitent à la prudence avant toute interprétation comme validation de terrain. La prochaine étape déterminante sera l'ouverture éventuelle du dataset ou du code : c'est ce qui distinguerait OmniRobotHome comme infrastructure de référence pour la communauté d'une contribution de laboratoire isolée.

RecherchePaper
1 source
Modèle de cognition du monde pour l'interaction humain-robot généralisable
3arXiv cs.RO 

Modèle de cognition du monde pour l'interaction humain-robot généralisable

Un article scientifique publié sur arXiv (référence 2607.22999v1) présente WCM, pour World-Cognition Model, un agent robotique conçu pour rendre l'interaction homme-robot aussi fluide que celle qu'offrent déjà les agents conversationnels dans le logiciel. Le système repose sur une architecture baptisée SLAK, acronyme de Sensing, Logic, Action et Knowledge, qui sépare explicitement la perception, le raisonnement, le contrôle moteur et la mémoire. Cette séparation s'appuie sur un runtime asynchrone permettant au raisonnement, au dialogue et à l'exécution de se dérouler en parallèle plutôt que séquentiellement. WCM ajoute un mode d'apprentissage supervisé par l'humain, où l'utilisateur peut enseigner interactivement au robot des tâches longues ou complexes ; ces épisodes d'enseignement, combinés aux exécutions autonomes, sont ensuite convertis en données de supervision par chaîne de raisonnement (chain-of-thought) pour affiner le modèle en continu. Sur neuf tâches réelles d'interaction homme-robot, le système atteint un taux de réussite moyen de 73,8 %, y compris sur des tâches exclues de l'entraînement par chaîne de raisonnement et sur une tâche longue apprise uniquement par démonstration humaine. L'enjeu dépassé ici n'est pas tant la performance brute que la question de la contrôlabilité. Les approches dominantes actuelles, qu'il s'agisse des politiques vision-langage-action (VLA) ou des planificateurs fondés sur des modèles du monde, sont optimisées pour exécuter une instruction, mais laissent peu de visibilité à l'utilisateur sur les raisons d'une action donnée et peu de moyens de corriger ou réorienter le robot en cours de tâche. En proposant un mécanisme explicite de correction et d'enseignement en temps réel, WCM répond à un point de friction identifié par les intégrateurs industriels : un robot qui exécute bien mais s'explique mal reste difficile à déployer et à faire confiance sur des tâches non anticipées. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles de fondation pour la robotique, où des architectures comme les VLA ont cherché à généraliser l'exécution de tâches à partir de démonstrations massives. WCM se positionne en complément plutôt qu'en rupture, en ajoutant une couche cognitive et interactive au-dessus du contrôle bas niveau. Les auteurs ne précisent pas de calendrier de déploiement industriel ni de partenaire commercial ; il s'agit à ce stade d'une publication de recherche, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et de plateformes robotiques.

RecherchePaper
1 source
4arXiv cs.RO 

Preuves d'interaction ancrées sur l'instance : ancrer les plans du robot dans les gestes de désignation et de manipulation humains

Des chercheurs proposent l'« instance-anchored interaction évidence » (IAE), une méthode qui permet à un robot d'agir sur ce qu'une personne a montré plutôt que dit : quel carton, parmi plusieurs identiques, a été désigné du doigt, ou quelle boîte a été manipulée. Le défaut à corriger est que le plan s'exécute à partir de la scène finale, alors que l'indice survient plus tôt, parfois sur des objets qui ont bougé depuis. L'IAE associe chaque objet de la scène finale à un identifiant public, conserve son identité tout au long de la vidéo par propagation arrière de masques, puis décrit chaque image par la géométrie entre mains, avant-bras et instances. Un réseau d'évidence, entraîné uniquement à partir des résultats des tâches, note les instances. Pour le pointage, un programme dynamique contraint par une grammaire, entraîné avec une perte structurée, décode des programmes objet-destination. Des programmes symboliques, sans apprentissage, traitent la désambiguïsation des références et les tâches épisodiques. Sur 1 255 requêtes du benchmark WatchAct, évaluées par exécution symbolique, l'IAE atteint 64,2 % de succès de plan sur les tâches à intention implicite, contre 27,5 % pour un modèle vision-langage de 32 milliards de paramètres (succès strict : 49,7 % contre 15,4 %). Sur la restauration, l'inversion et l'imitation, sans entraînement spécifique, elle obtient 46,4 % contre 27,0 %. Ces chiffres montrent que l'écart ne vient pas d'une meilleure perception brute, mais de la manière dont l'information est structurée. Les auteurs ont testé des contrôles avec les mêmes surcouches de perception, les mêmes 32 images, un suivi vers l'avant, ou un modèle de relations entraîné sur les mêmes étiquettes. Aucun n'explique le gain. Lorsque le même modèle de langage reçoit l'évidence de l'IAE sous forme de texte, avec sa signification expliquée, il monte à 57,4 %. L'essentiel du bénéfice vient donc de l'ancrage des preuves sur les instances, et les programmes explicites ajoutent 6,8 points à un coût bien moindre. Pour les intégrateurs et les équipes qui déploient des robots d'assistance en logistique ou en collaboration homme-robot, c'est un argument en faveur d'architectures hybrides (perception structurée plus exécution symbolique) plutôt que d'un grand modèle généraliste alimenté par des images brutes. Le pointage reste toutefois le cas le plus difficile, avec seulement 16,9 % de succès strict, ce qui rend la méthode inadaptée à un déploiement sans supervision pour ce type d'interaction. Il s'agit en outre d'un résultat de benchmark en laboratoire, et non d'un déploiement réel. Ce travail s'inscrit dans l'effort de rendre les modèles vision-langage-action et les planificateurs fondés sur des VLM capables de comprendre l'intention humaine dans des scènes encombrées, où l'identité des objets se perd quand ils sont déplacés. Les modèles généralistes de 32 milliards de paramètres restent la référence comparée ici, et leur faiblesse sur les objets identiques est mise en évidence. La publication est un preprint arXiv (v1), non évalué par des pairs, et le code est disponible sur GitHub (WeiZhou96/iae-watchact). Aucun calendrier de pilote industriel n'est annoncé. Les prochaines étapes probables concernent l'amélioration du pointage et la validation sur des robots réels, au-delà de l'évaluation par exécution symbolique.

RecherchePaper
1 source