Aller au contenu principal
RecherchearXiv cs.RO 

Résidus de pose à référence fixe pour mesurer le transfert d'indices entre jeux de données dans l'anticipation de l'interaction homme-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un modèle baptisé FRPR (fixed-référence pose residual) pour mesurer quels indices permettent à un robot social ou de service, évoluant dans un espace public, d'anticiper qu'une personne proche va s'approcher et le toucher. Le principe : un prédicteur géométrique, construit à partir de la boîte englobante et du masque de la personne, est entraîné puis gelé. Un réseau temporel apprend ensuite, à partir de la pose corporelle, une correction additive du logit, de sorte que chaque prédiction se décompose exactement en un terme géométrique et un terme de pose. L'évaluation porte sur deux jeux de données égocentriques publics enregistrés par des robots différents, HUI360 et SSUP-A, tous les choix étant faits sur les données source. De SSUP-A vers HUI360, la correction de pose fait passer la précision moyenne (AP) de 0,277 à 0,321. Dans le sens inverse, le gain n'est pas mesurable. L'asymétrie persiste face à une référence géométrique plus solide, sélectionnée sur la source. Le code et les données traitées sont publiés sur GitHub (WeiZhou96/FRPR-interaction-anticipation).

Le point à retenir pour les intégrateurs et les décideurs tient surtout aux limites que les auteurs reconnaissent eux-mêmes. Geler la référence géométrique n'apporte aucun avantage d'AP par rapport à un entraînement conjoint, et de simples bases géométriques ou des ensembles d'arbres restent compétitifs, voire meilleurs. La construction sert donc à mesurer, pas à prédire plus précisément. Surtout, avec des seuils fixés sur la source, les modèles neuronaux exploitant la géométrie ne détectent au mieux que 17 % des interactions cibles. Un modèle d'anticipation entraîné sur un robot et déployé sur un autre, dans un autre site, reste donc loin d'être exploitable en l'état. Cela rappelle que le transfert entre plateformes demeure un problème ouvert pour la robotique sociale, bien plus que ne le laissent croire les résultats obtenus sur un seul jeu de données.

Sur le plan des indices, les résultats sont instructifs mais restent à confirmer. Un résidu d'orientation de la tête apporte de petits gains dans les deux sens. Dans une analyse a posteriori, le fait qu'une personne fasse face à la caméra conserve la même direction discriminante d'un jeu de données à l'autre, alors que l'inclinaison de la tête (pitch) s'inverse. Ce dernier point suggère que certains signaux de pose dépendent de la hauteur de la caméra ou du comportement du public sur chaque site, et ne se généralisent pas. Ces conclusions viennent d'une étude académique sur deux jeux de données seulement, sans produit ni déploiement commercial associé. Elles servent surtout aux équipes qui conçoivent des robots d'accueil ou de service : le contact visuel et l'orientation du corps semblent plus fiables que des indices fins de posture, et toute validation devrait se faire sur le site cible plutôt que par transfert direct.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Le défi ERR@HRI 3.0 : détection multimodale des erreurs et anticipation dans les interactions homme-robot
1arXiv cs.RO 

Le défi ERR@HRI 3.0 : détection multimodale des erreurs et anticipation dans les interactions homme-robot

Détecter en temps réel qu'un robot vient de se tromper, ou qu'un humain à proximité va bientôt subir un échec, reste un problème ouvert pour l'interaction homme-robot. La troisième édition du challenge ERR@HRI, présentée dans un article déposé sur arXiv le 14 juillet 2026, propose deux jeux de données inédits pour faire avancer ce sujet. Le premier, Bystander Affect Detection (BAD), rassemble des enregistrements webcam de 45 participants réagissant spontanément à des scénarios d'échec robotique ou humain. Le second, Bad Idea, contient les réactions faciales anticipatoires de 29 participants tentant de prédire l'issue d'une action avant qu'un échec ne survienne. Les deux corpus, collectés par crowdsourcing avec des vidéos brutes non anonymisées, capturent la variabilité de conditions réelles plutôt que des données contrôlées en laboratoire. Trois pistes étaient proposées aux participants: détection des réactions de témoins (Track 1), prédiction anticipatoire d'issue (Track 2), et une piste optionnelle de généralisation cross-dataset (Track 3). Trois équipes ont soumis des modèles valides, tous supérieurs aux baselines à réseaux convolutifs (CNN) des organisateurs. L'enjeu dépasse la simple compétition académique: la plupart des systèmes de détection d'erreur actuels fonctionnent sur des contextes restreints, des environnements contrôlés ou des caractéristiques pré-extraites, ce qui limite fortement leur transfert vers des déploiements réels. En forçant les équipes à travailler sur de la vidéo brute multimodale et des scénarios naturalistes, ERR@HRI 3.0 teste directement si les approches actuelles tiennent face à l'écart classique entre démonstration en laboratoire et usage terrain. Pour les intégrateurs et concepteurs de robots sociaux ou collaboratifs, la capacité à anticiper un échec avant qu'il ne se produise, et pas seulement à le constater après coup, conditionne la confiance des utilisateurs et l'acceptabilité au quotidien de ces systèmes. Le fait qu'il s'agisse d'une troisième édition traduit un effort continu de la communauté recherche en interaction homme-robot pour structurer ce champ encore jeune, à travers des benchmarks partagés plutôt que des évaluations isolées propres à chaque laboratoire. Seules trois équipes ayant soumis des modèles valides, malgré le dépassement des baselines, l'article souligne que la détection et l'anticipation d'erreurs en conditions réelles restent un domaine en construction, avec des perspectives explicites vers des systèmes plus généralisables et conscients du contexte.

RecherchePaper
1 source
R2RI : un jeu de données multi-vues d'événements et RGB pour l'interaction robot-robot
2arXiv cs.RO 

R2RI : un jeu de données multi-vues d'événements et RGB pour l'interaction robot-robot

Des chercheurs publient R2RI (Robot-to-Robot Interaction), un jeu de données présenté comme le premier conçu spécifiquement pour la tâche d'interaction robot-robot (RRI). Il réunit plusieurs robots humanoïdes de modèles différents, mis en scène dans des interactions calquées sur des comportements sociaux humains réels. Chaque scène est filmée selon deux points de vue complémentaires : une vue égocentrique, issue des capteurs embarqués de chaque robot, et une vue exocentrique, captée par des caméras fixes extérieures. Le corpus compte plus de 6,5 millions d'images et environ 5 000 vidéos à 120 images par seconde, dans deux domaines : RGB classique et caméra événementielle, qui ne transmet que les changements de luminosité pixel par pixel, avec une latence très faible et une bonne tenue aux mouvements rapides. Les auteurs comparent les avantages et limites de chaque domaine en confrontant des approches de l'état de l'art sur plusieurs tâches clés de perception et d'interaction. Données et annotations sont publiées sur GitHub (MagriniGabriele/R2RI), pour toutes les tâches et toutes les modalités. L'enjeu est d'abord méthodologique. La modélisation des interactions entre agents autonomes pèse sur les systèmes collaboratifs, la robotique sociale et la coexistence homme-robot. Elle manquait pourtant de référence à grande échelle, ce qui empêchait de comparer les méthodes entre elles. Pour un intégrateur ou un responsable d'exploitation, l'intérêt est concret : à mesure que des flottes de robots hétérogènes partagent un même espace (entrepôt, usine, site logistique), la capacité d'un robot à interpréter les gestes et intentions d'un autre devient un sujet d'ingénierie, au-delà de la simple détection d'obstacles. L'ajout du flux événementiel est notable, car ce type de capteur est précisément pertinent pour des mouvements rapides ou des éclairages difficiles, où le RGB souffre de flou et de latence. Une réserve s'impose toutefois : il s'agit d'un jeu de données, sans démonstration de déploiement. Les interactions sont scénarisées et enregistrées en environnement contrôlé, et le résumé ne précise ni les modèles de robots utilisés, ni les tâches évaluées, ni les scores obtenus. L'écart entre benchmark et comportement autonome en conditions réelles reste donc entier. Ce travail s'inscrit dans une tendance visible de la vision et de la robotique : les jeux de données d'interaction se sont d'abord concentrés sur l'humain, avec des corpus d'interactions homme-homme ou homme-robot, alors que l'interaction entre machines restait quasi absente. Avec la multiplication des humanoïdes en phase pilote chez plusieurs acteurs américains et chinois, la question de la coordination entre robots de marques différentes va gagner en importance. Les suites probables sont l'adoption du jeu de données comme banc d'essai par d'autres laboratoires, puis l'entraînement de modèles de perception sociale ou de politiques multi-agents. Aucun calendrier industriel n'est annoncé et aucun acteur européen n'est cité dans le résumé. La valeur réelle de R2RI se jugera à son adoption par la communauté et à la diversité des plateformes qu'il couvre effectivement.

RecherchePaper
1 source
3arXiv cs.RO 

Preuves d'interaction ancrées sur l'instance : ancrer les plans du robot dans les gestes de désignation et de manipulation humains

Des chercheurs proposent l'« instance-anchored interaction évidence » (IAE), une méthode qui permet à un robot d'agir sur ce qu'une personne a montré plutôt que dit : quel carton, parmi plusieurs identiques, a été désigné du doigt, ou quelle boîte a été manipulée. Le défaut à corriger est que le plan s'exécute à partir de la scène finale, alors que l'indice survient plus tôt, parfois sur des objets qui ont bougé depuis. L'IAE associe chaque objet de la scène finale à un identifiant public, conserve son identité tout au long de la vidéo par propagation arrière de masques, puis décrit chaque image par la géométrie entre mains, avant-bras et instances. Un réseau d'évidence, entraîné uniquement à partir des résultats des tâches, note les instances. Pour le pointage, un programme dynamique contraint par une grammaire, entraîné avec une perte structurée, décode des programmes objet-destination. Des programmes symboliques, sans apprentissage, traitent la désambiguïsation des références et les tâches épisodiques. Sur 1 255 requêtes du benchmark WatchAct, évaluées par exécution symbolique, l'IAE atteint 64,2 % de succès de plan sur les tâches à intention implicite, contre 27,5 % pour un modèle vision-langage de 32 milliards de paramètres (succès strict : 49,7 % contre 15,4 %). Sur la restauration, l'inversion et l'imitation, sans entraînement spécifique, elle obtient 46,4 % contre 27,0 %. Ces chiffres montrent que l'écart ne vient pas d'une meilleure perception brute, mais de la manière dont l'information est structurée. Les auteurs ont testé des contrôles avec les mêmes surcouches de perception, les mêmes 32 images, un suivi vers l'avant, ou un modèle de relations entraîné sur les mêmes étiquettes. Aucun n'explique le gain. Lorsque le même modèle de langage reçoit l'évidence de l'IAE sous forme de texte, avec sa signification expliquée, il monte à 57,4 %. L'essentiel du bénéfice vient donc de l'ancrage des preuves sur les instances, et les programmes explicites ajoutent 6,8 points à un coût bien moindre. Pour les intégrateurs et les équipes qui déploient des robots d'assistance en logistique ou en collaboration homme-robot, c'est un argument en faveur d'architectures hybrides (perception structurée plus exécution symbolique) plutôt que d'un grand modèle généraliste alimenté par des images brutes. Le pointage reste toutefois le cas le plus difficile, avec seulement 16,9 % de succès strict, ce qui rend la méthode inadaptée à un déploiement sans supervision pour ce type d'interaction. Il s'agit en outre d'un résultat de benchmark en laboratoire, et non d'un déploiement réel. Ce travail s'inscrit dans l'effort de rendre les modèles vision-langage-action et les planificateurs fondés sur des VLM capables de comprendre l'intention humaine dans des scènes encombrées, où l'identité des objets se perd quand ils sont déplacés. Les modèles généralistes de 32 milliards de paramètres restent la référence comparée ici, et leur faiblesse sur les objets identiques est mise en évidence. La publication est un preprint arXiv (v1), non évalué par des pairs, et le code est disponible sur GitHub (WeiZhou96/iae-watchact). Aucun calendrier de pilote industriel n'est annoncé. Les prochaines étapes probables concernent l'amélioration du pointage et la validation sur des robots réels, au-delà de l'évaluation par exécution symbolique.

RecherchePaper
1 source
Comprendre l'engagement et l'intrusivité dans l'interaction homme-robot assistive selon les traits individuels
4arXiv cs.RO 

Comprendre l'engagement et l'intrusivité dans l'interaction homme-robot assistive selon les traits individuels

Une étude diffusée sur arXiv (2609.21744v1) s'intéresse à la manière dont les utilisateurs perçoivent l'engagement et l'intrusivité d'un robot assistant selon leurs traits individuels. Les auteurs ont mené une expérience avec 32 participants confrontés à une tâche inconnue, assistés successivement par deux robots offrant un soutien similaire mais des stratégies d'intervention différentes, en particulier sur la fréquence de leurs interventions plutôt que sur la seule distance physique. Résultat: l'engagement global reste stable d'un robot à l'autre, mais les réponses affectives et le sentiment d'intrusivité varient fortement selon la personnalité, qui influence aussi différemment la dynamique d'interaction selon le comportement du robot. Ce constat nuance un débat récurrent en interaction homme-robot: certains travaux antérieurs jugeaient qu'une proximité plus étroite renforce l'engagement, d'autres qu'elle est perçue comme intrusive. L'étude suggère que la proxémie seule n'explique pas ce ressenti, la fréquence des interventions et le profil individuel pesant au moins autant. Pour les concepteurs de robots d'assistance en industrie, santé ou logistique, cela plaide contre un comportement robotique uniforme: un réglage calibré pour un utilisateur moyen peut se révéler intrusif pour certains et sous-stimulant pour d'autres, ce qui pousse vers des comportements adaptatifs, ajustés au profil psychologique et démographique de chaque personne plutôt qu'à une distance ou une fréquence fixe. Ce travail s'inscrit dans un champ où les preuves sur la proxémie robotique restaient contradictoires, sans que la fréquence d'intervention ou les différences interindividuelles ne soient clairement isolées comme variables explicatives. L'abstract ne précise ni l'institution porteuse ni les robots utilisés, et l'échantillon reste limité à 32 personnes, ce qui invite à la prudence avant toute généralisation. La suite logique serait une validation à plus grande échelle et des stratégies d'adaptation automatique du comportement robotique au profil détecté de l'utilisateur, un enjeu direct pour les fabricants de robots de service et d'assistance visant des publics variés.

RecherchePaper
1 source