Aller au contenu principal
RecherchearXiv cs.RO 

Cadre visuel intégrant indices d'attention et d'action pour l'évaluation interprétable de la charge cognitive en collaboration homme-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent, dans une étude publiée sur arXiv (arXiv:2609.15232v1, soumise le 15 septembre 2026), un système de vision par ordinateur destiné à mesurer la charge cognitive des opérateurs en collaboration homme-robot sans capteurs physiologiques portés sur le corps. Le framework combine des caméras RGB-D, l'état du robot et des zones de tâches calibrées pour construire une représentation temporelle du comportement de l'opérateur, appelée HRC-CWL, qui repère où se concentre la charge de travail et comment elle évolue lorsque l'attention et l'action divergent, que le contexte de tâche change ou que l'opérateur hésite. L'équipe a testé son approche sur un assemblage collaboratif de boîte de vitesses à trois niveaux de difficulté, avec dix participants. Les scores subjectifs NASA-TLX ont confirmé une hausse de la charge perçue selon les conditions, avec des effets significatifs sur la charge globale et ses dimensions mentale et temporelle. La sortie du système vision a été significativement corrélée aux signaux ECG chez sept participants sur neuf disposant de données complètes, et les épisodes d'hésitation détectés par la caméra correspondaient temporellement à l'activité physiologique mesurée. Le système a fonctionné en temps réel sans équipement porté par l'opérateur.

Pour l'industrie de l'assemblage collaboratif, ce travail répond à un obstacle pratique connu: les méthodes actuelles d'évaluation de la charge mentale reposent sur des capteurs physiologiques (ECG, EEG, dermographes) jugés trop intrusifs pour un déploiement industriel réel. En démontrant une corrélation partielle mais significative entre un signal purement visuel et des mesures physiologiques de référence, l'étude ouvre la voie à une ergonomie cognitive adaptative, où le robot ajusterait son rythme ou son comportement selon l'état inféré de l'opérateur, sans instrumentation supplémentaire. Les auteurs restent prudents: ils présentent HRC-CWL comme un proxy comportemental interprétable, pas comme une mesure psychophysiologique directe de la charge, ce qui tempère toute promesse de diagnostic médical précis.

Ce travail s'inscrit dans la tendance de la robotique collaborative industrielle (cobots) à intégrer des capacités de perception fine des états humains, un axe de recherche actif face à la multiplication des lignes d'assemblage mixtes homme-robot. L'échantillon reste limité à dix participants et un seul scénario de gearbox, ce qui appelle des validations à plus grande échelle avant tout déploiement en usine.

Dans nos dossiers

À lire aussi

Modélisation de la charge cognitive et physique perçue pour la collaboration homme-robot en construction préfabriquée
1arXiv cs.RO 

Modélisation de la charge cognitive et physique perçue pour la collaboration homme-robot en construction préfabriquée

Une étude déposée sur arXiv (arXiv:2606.15494) propose un cadre de modélisation empirique de l'évolution de la charge cognitive et physique perçue des opérateurs en contexte de collaboration humain-robot (HRC) dans la construction préfabriquée. Les chercheurs ont conduit une expérience contrôlée de cycles travail-repos répétés, mesurant la charge cognitive via l'échelle RSME (Rating Scale for Mental Effort) et l'effort physique via l'indice de Borg RPE (Rating of Perceived Exertion). Les résultats montrent que l'accumulation de la charge cognitive suit une progression linéaire, tandis que la récupération en phase de repos obéit à une décroissance non linéaire de type exponentielle. Un modèle à effets mixtes a été appliqué pour tenir compte des conditions collaboratives, des effets de session et de la variabilité inter-individuelle significative entre opérateurs. Ces résultats ont une portée directe pour la planification des tâches en HRC industrielle. Les approches de scheduling humain-robot reposent encore souvent sur des hypothèses simplifiées : fatigue constante, récupération uniforme, ou seuils de charge binaires. Disposer d'un modèle empiriquement validé qui distingue la dynamique d'accumulation (linéaire) de celle de récupération (non linéaire) permet de concevoir des algorithmes d'allocation de tâches capables d'anticiper l'état cognitif et physique du travailleur au fil des cycles de production. Pour un intégrateur ou un COO déployant des cobots sur ligne d'assemblage préfabriqué, cela ouvre la voie à des plannings adaptatifs qui réduisent le risque d'erreur humaine et de troubles musculo-squelettiques sans sacrifier la cadence. La construction préfabriquée est un secteur cible croissant pour la robotique collaborative, notamment pour des tâches répétitives de manutention lourde, d'assemblage de panneaux et de fixation. Des équipes universitaires en Asie-Pacifique et en Europe travaillent sur l'automatisation partielle de ce segment, mais la grande majorité des déploiements HRC existants ignorent l'état physiologique du travailleur comme variable de planification en temps réel. Cette étude s'inscrit dans la tendance émergente de la HRC "human-state-aware", où le système robotique adapte sa charge de travail à l'état de l'opérateur. Les modèles proposés constituent une brique méthodologique destinée à alimenter de futurs systèmes de scheduling dynamique, potentiellement couplés à des capteurs physiologiques embarqués ou à des outils de suivi biométrique non intrusifs.

UEDes équipes universitaires européennes sont mentionnées comme actives sur l'automatisation en construction préfabriquée, mais aucun acteur français ou européen spécifique n'est impliqué dans cette étude ; l'impact reste indirect pour les intégrateurs HRC en Europe.

RecherchePaper
1 source
HRIBench : évaluation de la collaboration homme-robot centrée sur l'interaction
2arXiv cs.RO 

HRIBench : évaluation de la collaboration homme-robot centrée sur l'interaction

Ce papier arXiv (2607.13056v1) présente HRIBench, un benchmark diagnostique conçu pour évaluer la collaboration homme-robot centrée sur l'interaction, plutôt que la seule manipulation isolée. Contrairement aux benchmarks VLA (vision-language-action) existants, qui testent des compétences de manipulation déconnectées de toute interaction humaine, HRIBench modélise les tâches collaboratives sous forme de scénarios structurés intégrant rôles des agents, dépendances temporelles, contraintes de coordination et distributions de comportement humain. Trois rôles sont définis : Instructeur, Collaborateur et Intrus, couvrant respectivement la communication d'intention, la coordination conjointe et la robustesse face à une intervention humaine imprévue. Le benchmark comprend 13 tâches conditionnées par rôle et plus de 650 épisodes d'évaluation générés à partir de trajectoires d'interaction et de variations de scène diverses. Les chercheurs ont testé des politiques adaptées à partir de GR00T, pi0.5 et ACT selon un protocole unifié, avec des métriques allant au-delà du simple taux de réussite : synchronisation, réactivité, respect du protocole et sécurité. Les résultats montrent que les politiques robotiques actuelles, malgré de bonnes capacités de manipulation pure, peinent nettement dès qu'il s'agit de coordination temporelle et de comportement sensible à l'intention humaine, un angle mort largement ignoré par les benchmarks existants. Ce constat vient nuancer l'idée que les modèles VLA généralistes seraient déjà prêts pour une collaboration homme-robot fluide en environnement partagé, un enjeu central pour tout déploiement industriel où humains et robots opèrent côte à côte. Fait notable, un fine-tuning sur les données HRIBench améliore systématiquement les performances collaboratives, et en conditions réelles, les données de simulation générées par le benchmark font passer le taux de réussite de GR00T N1.5 sur une tâche physique de 0,10 à 0,43. HRIBench s'inscrit dans une dynamique de recherche cherchant à combler l'écart entre benchmarks de manipulation pure et exigences réelles de la cohabitation homme-robot, à mesure que des politiques comme GR00T (NVIDIA), pi0.5 (Physical Intelligence) ou ACT gagnent en usage comme bases pour l'apprentissage robotique généraliste. Les auteurs positionnent leur travail comme un outil diagnostique réutilisable, avec des pistes explicites de fine-tuning ciblé pour renforcer la coordination et la sécurité, plutôt qu'un simple classement de performances brutes.

RecherchePaper
1 source
Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée
3arXiv cs.RO 

Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée

Une équipe de chercheurs a publié TouchSafeBench (arXiv:2605.31196), un benchmark pour évaluer ce qu'ils nomment le "collision grounding" dans les modèles de vision-langage (VLM) : la capacité à relier des observations visuelles à la géométrie du robot, la disposition de la scène et la proximité humaine pour déduire un contact présent ou imminent. Construit dans le simulateur Habitat 3.0 de Meta, il comprend 2 940 épisodes de coprésence indoor simulés, couvrant navigation sociale et réorganisation spatiale, avec des observations RGB-D multi-vues synchronisées, des cartes de trajectoire top-down et des labels de contact dérivés directement du simulateur. Trois VLMs orientés robotique ou frontier models ont été testés sur neuf représentations visuelles, autour de deux tâches : classifier l'état de sécurité courant et anticiper une collision imminente avant tout contact physique. Le meilleur score moyen Macro-F1 obtenu reste inférieur à 50 %. Ce chiffre souligne une limite fondamentale : la fluidité visuelle n'implique pas la responsabilité physique. Un modèle capable de décrire précisément une scène peut échouer à détecter si un bras robotique effleure un opérateur. Pour les intégrateurs travaillant sur la collaboration homme-robot, le signal est sans ambiguité : les VLMs actuels ne peuvent pas jouer le rôle de moniteurs de sécurité sans couche d'abstraction géométrique explicite. L'étude montre également que le contact robot-scène (obstacles, mobilier) est systématiquement plus difficile à détecter que la proximité humaine, contredisant l'intuition courante. Plus frappant encore : la profondeur RGB-D n'est pas automatiquement convertie en évidence de collision corps-robot, faute de représentation morphologique intégrée dans ces modèles. Ces résultats arrivent au moment où les architectures vision-langage-action (VLA) comme RT-2, OpenVLA ou pi0 de Physical Intelligence s'imposent dans les pipelines robotiques, en pariant sur la généralisation sémantique des VLMs pour piloter manipulateurs et robots mobiles. TouchSafeBench constitue un contrepoids empirique à cet enthousiasme : la généralisation linguistique ne résout pas la conscience géométrique nécessaire à la sécurité fonctionnelle. La plateforme sous-jacente, Habitat 3.0, est développée par Meta AI Research et fait référence en navigation sociale simulée. Le benchmark sera publié à l'acceptation de l'article. Les auteurs identifient comme prochaine étape des représentations liant explicitement point de vue caméra, morphologie du robot et géométrie métrique, potentiellement via des approches hybrides VLM et modèles cinématiques.

UELes intégrateurs européens développant des cobots sous contraintes AI Act doivent intégrer que les VLMs actuels ne sont pas des moniteurs de sécurité fiables sans couche d'abstraction géométrique explicite, ce qui impacte directement les architectures VLA en cours de déploiement industriel.

RecherchePaper
1 source
Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot
4arXiv cs.RO 

Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot

Une étude publiée sur arXiv (identifiant 2606.20150) en juin 2026 évalue de manière systématique cinq méthodes de suivi d'état d'assemblage à partir de la reconnaissance d'actions humaines (HAR), dans le cadre de la collaboration homme-robot (HRC). Les chercheurs ont testé des approches à base de règles logiques, de modèles de Markov cachés (HMM) et de réseaux de neurones (NN) sur deux jeux de données aux caractéristiques différentes. Les tests combinent des entrées simulées avec différents niveaux de bruit et des entrées réalistes issues d'un modèle HAR opérationnel. L'objectif est de déterminer quelle méthode permet de suivre fidèlement l'état d'une tâche d'assemblage coopérative, étape par étape, à partir de la seule reconnaissance des gestes humains. Les résultats contredisent l'hypothèse dominante selon laquelle les approches par réseaux de neurones surpassent systématiquement les méthodes classiques. Les NN et HMM affichent de bonnes performances sur des tâches à faible variabilité, mais se révèlent fragiles face à des séquences atypiques ou bruitées. Les méthodes logiques, bien que moins sophistiquées, se montrent plus robustes dans les scénarios à haute variabilité. Par ailleurs, la modélisation de la durée attendue des actions s'avère critique pour les tâches comportant des actions répétées, notamment lorsqu'aucun capteur complémentaire ne fournit de signal de confirmation. Ce constat a des implications directes pour les intégrateurs industriels qui déploient des cellules HRC sur des lignes d'assemblage réelles : choisir un modèle d'inférence d'état inadapté au profil de la tâche peut entraîner des erreurs de synchronisation robot-opérateur difficiles à diagnostiquer. Ce travail s'inscrit dans un domaine de recherche en pleine effervescence, porté par l'essor des robots collaboratifs (cobots) dans les environnements manufacturiers. Des acteurs comme Universal Robots, FANUC ou encore des laboratoires européens tels que ceux du LAAS-CNRS et de Fraunhofer travaillent sur des pipelines HAR similaires pour des applications d'assistance à l'assemblage. La difficulté centrale, le "demo-to-reality gap" entre conditions de laboratoire et déploiement en usine, reste entière. Cette étude ne propose pas de solution universelle mais établit une carte comparative utile, à condition que les praticiens caractérisent d'abord la variabilité réelle de leur tâche avant de sélectionner une architecture de suivi d'état.

UELe LAAS-CNRS et Fraunhofer sont explicitement cités comme acteurs travaillant sur des pipelines HAR similaires, et les conclusions comparatives offrent une grille de décision directement utilisable par les intégrateurs européens qui déploient des cellules cobot sur des lignes d'assemblage réelles.

RecherchePaper
1 source