Aller au contenu principal
RecherchearXiv cs.RO 

SAGE : un gradient conforme à la sécurité pour la collaboration homme-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié le 21 septembre 2026 sur arXiv (2609.21130), l'article présente SAGE (Safety-Aligned Gradient Enforcement), un cadre de renforcement multi-agent pour la collaboration homme-robot, qui combine des politiques de décision arborescentes auditables avec un filtrage par fonctions de barrière de contrôle (CBF) assurant la sécurité physique. Deux mécanismes le composent : SAIL, qui internalise les contraintes de sécurité via une carte de proposition différentiable tout en gardant le programme quadratique CBF exact à l'exécution, et TALO, qui aligne les mises à jour individuelles des agents sur une référence d'équipe via une correction de Lyapunov. Testé avec deux robots humanoïdes et un partenaire humain en conditions physiques réelles, SAGE atteint en simulation, sur neuf scénarios, un taux de réussite de 71,0% pour seulement 0,5 collision par millier de pas. Les ablations révèlent qu'un filtrage CBF seul réduit les collisions de 98,5% mais fait chuter la réussite de 67,3% à 59,3%, alors que SAIL réduit les violations de 48,8% et les corrections d'exécution de 85,2%, et TALO réduit l'écart de cohérence des mises à jour de 50,8%.

Le compromis mis en évidence par l'ablation CBF illustre une tension centrale pour les intégrateurs déployant des robots en espace partagé avec des humains : moins de collisions, mais une réussite en repli de huit points. Un filtre de sécurité générique dégrade donc la performance de tâche. En montrant que l'internalisation différentiable des contraintes et une coordination explicite entre agents limitent ce compromis, SAGE argumente pour des architectures de sécurité co-conçues avec la politique plutôt qu'ajoutées après coup, un point pertinent pour les décideurs évaluant des solutions de cobotique où l'auditabilité des décisions pèse autant que la sécurité.

SAGE s'inscrit dans une recherche qui tente de concilier garanties de sécurité formelles et interprétabilité des politiques, à mesure que des humanoïdes opèrent aux côtés d'humains en atelier ou en entrepôt. Le papier reste un preprint arXiv non relu par les pairs, sans entreprise ni marque de robot citée ; sa validation physique se limite à un démonstrateur avec deux robots et un humain, loin d'un déploiement industriel, avant une évaluation à plus grande échelle et une publication en conférence.

Dans nos dossiers

À lire aussi

Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée
1arXiv cs.RO 

Évaluation de la compréhension des collisions dans les modèles vision-langage pour une collaboration homme-robot sécurisée

Une équipe de chercheurs a publié TouchSafeBench (arXiv:2605.31196), un benchmark pour évaluer ce qu'ils nomment le "collision grounding" dans les modèles de vision-langage (VLM) : la capacité à relier des observations visuelles à la géométrie du robot, la disposition de la scène et la proximité humaine pour déduire un contact présent ou imminent. Construit dans le simulateur Habitat 3.0 de Meta, il comprend 2 940 épisodes de coprésence indoor simulés, couvrant navigation sociale et réorganisation spatiale, avec des observations RGB-D multi-vues synchronisées, des cartes de trajectoire top-down et des labels de contact dérivés directement du simulateur. Trois VLMs orientés robotique ou frontier models ont été testés sur neuf représentations visuelles, autour de deux tâches : classifier l'état de sécurité courant et anticiper une collision imminente avant tout contact physique. Le meilleur score moyen Macro-F1 obtenu reste inférieur à 50 %. Ce chiffre souligne une limite fondamentale : la fluidité visuelle n'implique pas la responsabilité physique. Un modèle capable de décrire précisément une scène peut échouer à détecter si un bras robotique effleure un opérateur. Pour les intégrateurs travaillant sur la collaboration homme-robot, le signal est sans ambiguité : les VLMs actuels ne peuvent pas jouer le rôle de moniteurs de sécurité sans couche d'abstraction géométrique explicite. L'étude montre également que le contact robot-scène (obstacles, mobilier) est systématiquement plus difficile à détecter que la proximité humaine, contredisant l'intuition courante. Plus frappant encore : la profondeur RGB-D n'est pas automatiquement convertie en évidence de collision corps-robot, faute de représentation morphologique intégrée dans ces modèles. Ces résultats arrivent au moment où les architectures vision-langage-action (VLA) comme RT-2, OpenVLA ou pi0 de Physical Intelligence s'imposent dans les pipelines robotiques, en pariant sur la généralisation sémantique des VLMs pour piloter manipulateurs et robots mobiles. TouchSafeBench constitue un contrepoids empirique à cet enthousiasme : la généralisation linguistique ne résout pas la conscience géométrique nécessaire à la sécurité fonctionnelle. La plateforme sous-jacente, Habitat 3.0, est développée par Meta AI Research et fait référence en navigation sociale simulée. Le benchmark sera publié à l'acceptation de l'article. Les auteurs identifient comme prochaine étape des représentations liant explicitement point de vue caméra, morphologie du robot et géométrie métrique, potentiellement via des approches hybrides VLM et modèles cinématiques.

UELes intégrateurs européens développant des cobots sous contraintes AI Act doivent intégrer que les VLMs actuels ne sont pas des moniteurs de sécurité fiables sans couche d'abstraction géométrique explicite, ce qui impacte directement les architectures VLA en cours de déploiement industriel.

RecherchePaper
1 source
Emballer à ma façon : collaboration homme-robot triadique pour un emballage autonome personnalisé
2arXiv cs.RO 

Emballer à ma façon : collaboration homme-robot triadique pour un emballage autonome personnalisé

Une équipe de recherche présente dans un article publié le 4 septembre 2026 sur arXiv (2609.04620) une étude sur le rangement autonome personnalisé par robot, où les préférences de l'utilisateur ne peuvent pas être déduites de la seule géométrie de la scène. Les chercheurs testent une collaboration triadique impliquant un résident, un médiateur de correction et un robot, en comparant deux formes de médiation : un expert humain en téléopération contre un agent vocal. L'étude, menée via un protocole nommé Show-Correct-Generalize, évalue trois catégories de tâches, protection, compacité et regroupement, en mesurant la capacité du robot à corriger son comportement puis à généraliser cette correction lorsque les objets environnants sont réarrangés. Résultat central : la médiation par agent vocal obtient des performances comparables à celle de l'expert humain sur deux des trois catégories de préférences testées, malgré des instructions plus courtes et moins détaillées. Les deux modes de médiation sont jugés aussi faciles à utiliser l'un que l'autre, mais l'expert humain reste perçu comme plus fiable par les utilisateurs. Ce résultat intéresse directement les intégrateurs et les décideurs travaillant sur l'autonomie domestique et logistique des robots, car il attaque un goulot d'étranglement connu : le déploiement à grande échelle de robots personnalisables reste bridé par la nécessité d'un téléopérateur expert pour interpréter les préférences humaines. Si un agent vocal peut approcher les performances humaines sur la correction et la généralisation de préférences, cela ouvre la voie à des déploiements sans supervision experte continue, réduisant le coût opérationnel du dernier kilomètre de personnalisation. L'étude reste toutefois nuancée : elle documente aussi les limites actuelles, notamment sur la fiabilité perçue et la généralisation dans certains cas, ce qui tempère l'idée d'un problème déjà résolu. Ce travail s'inscrit dans la lignée des recherches sur les architectures vision-langage-action (VLA) et l'apprentissage de préférences pour la manipulation robotique, un axe où des acteurs comme les développeurs de Pi-0 ou GR00T N2 explorent aussi l'interaction naturelle homme-robot pour des tâches ménagères ou industrielles. L'article ne mentionne pas de déploiement commercial ni de partenaire industriel identifié, il s'agit d'une étude utilisateur en laboratoire destinée à orienter les futures architectures de médiation vocale pour l'autonomie personnalisée, avec la fiabilité perçue et la généralisation des préférences comme prochains chantiers de recherche.

RecherchePaper
1 source
Intégrer la conformité à la norme ISO 10218 dans les robots via les fonctions barrière de contrôle pour la collaboration homme-robot
3arXiv cs.RO 

Intégrer la conformité à la norme ISO 10218 dans les robots via les fonctions barrière de contrôle pour la collaboration homme-robot

Des chercheurs ont publié sur arXiv (réf. 2606.13203) une approche de contrôle permettant d'intégrer nativement la conformité à la norme ISO 10218 dans les robots industriels collaboratifs, en s'appuyant sur une Fonction Barrière de Contrôle (CBF). Le système a été validé en simulation et en conditions réelles sur un bras UR10e d'Universal Robots. Plutôt que de se contenter des hypothèses conservatives des modules SSM (Speed and Separation Monitoring) classiques, qui supposent une vitesse humaine constante, la CBF proposée intègre les données d'accélération humaine pour prédire analytiquement la distance de séparation minimale humain-robot le long d'une trajectoire d'arrêt en cas de pire scénario. Deux méthodes sont présentées : Method I, un filtre de sécurité PD contraint par CBF, et Method II, un contrôleur SQP (Sequential Quadratic Programming) qui impose une contrainte de tube spatial sur la trajectoire. Method II réduit l'erreur de trajectoire moyenne de 63 % par rapport à Method I, et supprime les manoeuvres évasives excessives qui dégradent le débit opérationnel. L'enjeu industriel est direct : les modules SSM standard génèrent des arrêts préventifs fréquents parce qu'ils surestiment le risque de collision, faute de pouvoir anticiper les mouvements humains. Dans un contexte d'atelier où des cobots travaillent aux côtés d'opérateurs, ces arrêts non nécessaires représentent un coût de productivité réel. La méthode proposée déplace le curseur : au lieu d'un filtre de vitesse binaire (go/stop), le contrôleur module dynamiquement la vitesse d'exécution et la déviation spatiale du robot en temps réel, en restant dans les limites de la norme. C'est un pas vers des cobots réellement compétitifs en termes de cycle time, sans sacrifier la conformité réglementaire. La norme ISO 10218, qui régit la sécurité des robots industriels, est aujourd'hui au coeur des déploiements de cobots chez des fabricants comme FANUC, KUKA, ABB ou Universal Robots. Le SSM est l'approche la plus répandue pour y répondre, mais son conservatisme est documenté depuis plusieurs années. Les CBF, issues de la théorie du contrôle, émergent comme alternative formellement vérifiable, et plusieurs groupes académiques (MIT, ETH, TU Munich) explorent cette direction. La prochaine étape probable est l'intégration de ces contraintes dans des environnements multi-robots et des scénarios à personnes multiples, plus représentatifs de la réalité des ateliers.

UELa norme ISO 10218 étant centrale pour les déploiements de cobots chez KUKA (Allemagne) et ABB (Suisse-Suède), cette approche CBF pourrait réduire les arrêts non productifs dans les ateliers européens et renforcer la compétitivité des intégrateurs face aux contraintes de la directive Machines révisée.

RecherchePaper
1 source
Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot
4arXiv cs.RO 

Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot

Une étude publiée sur arXiv (identifiant 2606.20150) en juin 2026 évalue de manière systématique cinq méthodes de suivi d'état d'assemblage à partir de la reconnaissance d'actions humaines (HAR), dans le cadre de la collaboration homme-robot (HRC). Les chercheurs ont testé des approches à base de règles logiques, de modèles de Markov cachés (HMM) et de réseaux de neurones (NN) sur deux jeux de données aux caractéristiques différentes. Les tests combinent des entrées simulées avec différents niveaux de bruit et des entrées réalistes issues d'un modèle HAR opérationnel. L'objectif est de déterminer quelle méthode permet de suivre fidèlement l'état d'une tâche d'assemblage coopérative, étape par étape, à partir de la seule reconnaissance des gestes humains. Les résultats contredisent l'hypothèse dominante selon laquelle les approches par réseaux de neurones surpassent systématiquement les méthodes classiques. Les NN et HMM affichent de bonnes performances sur des tâches à faible variabilité, mais se révèlent fragiles face à des séquences atypiques ou bruitées. Les méthodes logiques, bien que moins sophistiquées, se montrent plus robustes dans les scénarios à haute variabilité. Par ailleurs, la modélisation de la durée attendue des actions s'avère critique pour les tâches comportant des actions répétées, notamment lorsqu'aucun capteur complémentaire ne fournit de signal de confirmation. Ce constat a des implications directes pour les intégrateurs industriels qui déploient des cellules HRC sur des lignes d'assemblage réelles : choisir un modèle d'inférence d'état inadapté au profil de la tâche peut entraîner des erreurs de synchronisation robot-opérateur difficiles à diagnostiquer. Ce travail s'inscrit dans un domaine de recherche en pleine effervescence, porté par l'essor des robots collaboratifs (cobots) dans les environnements manufacturiers. Des acteurs comme Universal Robots, FANUC ou encore des laboratoires européens tels que ceux du LAAS-CNRS et de Fraunhofer travaillent sur des pipelines HAR similaires pour des applications d'assistance à l'assemblage. La difficulté centrale, le "demo-to-reality gap" entre conditions de laboratoire et déploiement en usine, reste entière. Cette étude ne propose pas de solution universelle mais établit une carte comparative utile, à condition que les praticiens caractérisent d'abord la variabilité réelle de leur tâche avant de sélectionner une architecture de suivi d'état.

UELe LAAS-CNRS et Fraunhofer sont explicitement cités comme acteurs travaillant sur des pipelines HAR similaires, et les conclusions comparatives offrent une grille de décision directement utilisable par les intégrateurs européens qui déploient des cellules cobot sur des lignes d'assemblage réelles.

RecherchePaper
1 source