Aller au contenu principal
RecherchearXiv cs.RO 

HazardArena : évaluer la sécurité sémantique des modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2604.12447, version 2, mise à jour de la disponibilité du code) présente HazardArena, un benchmark conçu pour évaluer la sécurité sémantique des modèles Vision-Language-Action (VLA), ces systèmes qui pilotent des robots en combinant perception visuelle, compréhension du langage et exécution d'actions. Le jeu de données comprend plus de 2 000 assets et 40 tâches sensibles au risque, réparties en 7 catégories de danger réel calquées sur des normes de sécurité robotique établies. Sa spécificité tient à des paires de scénarios jumeaux, sûr et dangereux, qui partagent exactement les mêmes objets, la même disposition spatiale et les mêmes consignes d'action, et ne diffèrent que par le contexte sémantique déterminant si l'action devient risquée. Les auteurs montrent que des modèles VLA entraînés uniquement sur les versions sûres échouent fréquemment à ajuster leur comportement face aux scénarios dangereux correspondants, exécutant la tâche demandée sans tenir compte du risque contextuel. Pour y remédier, l'équipe propose une "Safety Option Layer", un module ajouté sans réentraînement du modèle, qui restreint l'exécution des actions à l'aide d'attributs sémantiques ou d'un juge vision-langage, réduisant nettement les comportements dangereux avec un impact limité sur la performance des tâches. Le code est publié sur GitHub, sous HazardArena-Team.

Ce travail met en évidence une faille méthodologique dans la manière dont l'industrie évalue aujourd'hui les modèles VLA: la réussite d'une action ne garantit pas qu'elle soit exécutée en toute sécurité, car les politiques d'action restent faiblement couplées à la sémantique visuelle et linguistique du contexte. Pour les intégrateurs et décideurs qui déploient des robots pilotés par des modèles fondation en environnement réel, entrepôts, sites industriels ou domiciles, cela signifie que les benchmarks de performance actuels ne suffisent pas à garantir un comportement sûr face à des variations contextuelles subtiles. L'approche sans réentraînement proposée est notable car elle offre une voie de correction peu coûteuse, applicable a posteriori sur des modèles déjà entraînés, plutôt que d'exiger une refonte complète des pipelines d'apprentissage.

HazardArena s'inscrit dans un mouvement plus large de scrutin critique des modèles VLA à mesure qu'ils passent des démonstrations en laboratoire à des déploiements réels, où la diversité des contextes rend les défaillances sémantiques plus probables qu'en environnement contrôlé. Les auteurs présentent leur travail comme un appel à repenser l'évaluation et l'application de la sécurité sémantique dans ces modèles à l'échelle, sans annoncer de partenariat industriel ni de déploiement commercial associé. Le code et les données étant publiés en accès ouvert, l'initiative vise avant tout la communauté de recherche en robotique et en IA embarquée, plutôt qu'un produit ou un pilote destiné à des clients.

À lire aussi

SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action
1arXiv cs.RO 

SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action

Une équipe de recherche présente SafeStage, un benchmark structuré en trois étapes pour évaluer la sécurité des politiques de manipulation robotique conditionnées par le langage et la vision (VLA), publié sur arXiv (arXiv:2609.21223v1) en septembre 2026. L'outil comprend 97 scénarios de risque conçus spécifiquement pour tester trois phases du cycle de manipulation : les « dangers d'état initial » (relations spatiales ou physiques à résoudre avant de toucher à l'objet cible), la « sécurité pendant l'exécution » (contacts non intentionnels, trajectoires dangereuses, entrées dans des zones interdites, interactions non voulues avec d'autres objets) et les « dangers d'état final » (conditions instables ou dangereuses subsistant après l'achèvement nominal de la tâche). Le benchmark combine des vérifications basées sur les événements et sur l'état du système, et rapporte le taux de succès de la tâche indépendamment des résultats de sécurité propres à chaque étape. Les chercheurs ont testé des politiques VLA à action directe représentatives ainsi que des politiques s'appuyant sur des modèles du monde, dans un protocole commun en boucle fermée. Le résultat central est qu'une tâche accomplie avec succès coexiste fréquemment avec des violations de sécurité, et que les différentes politiques testées présentent des profils d'échec distincts selon l'étape du cycle concernée. Ce découplage entre succès de tâche et sécurité vient contredire une hypothèse implicite répandue dans le secteur, celle qu'un robot qui termine sa tâche l'a nécessairement fait de manière sûre. Pour les intégrateurs et décideurs industriels évaluant des politiques VLA généralistes en vue d'usages en ligne de production ou en environnement partagé avec des humains, SafeStage offre un outil de diagnostic permettant de localiser précisément quand et comment une politique échoue en matière de sécurité, plutôt que de se fier à un simple taux de réussite de tâche ou à des tests isolés de refus sémantique. Ce constat arrive alors que la course aux politiques VLA généralistes, portée par des familles de modèles comme Pi-0, GR00T ou Helix dans l'écosystème plus large de la manipulation robotique, s'accélère sur la base de démonstrations souvent impressionnantes mais rarement soumises à une évaluation systématique de sécurité en boucle fermée. Ce travail répond à une lacune des benchmarks existants, généralement centrés soit sur le succès de tâche, soit sur des contraintes physiques isolées, soit sur le refus sémantique de commandes dangereuses, soit sur des dommages physiques déjà constatés après coup, sans permettre de localiser à quel moment précis du cycle de manipulation survient une violation. En proposant un banc d'essai unifié et diagnostique, les auteurs visent un outil réutilisable pour comparer et améliorer les politiques VLA à mesure qu'elles se rapprochent d'un déploiement industriel réel. Le papier ne mentionne ni partenariat commercial ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche académique destinée à la communauté robotique, sans acteur ni déploiement réel annoncé, ce qui la distingue nettement des communiqués marketing habituels du secteur des robots humanoïdes.

UECe benchmark académique n'implique aucun acteur français ou européen mais offre un outil générique que des intégrateurs robotiques européens pourraient utiliser pour évaluer la sécurité de politiques VLA avant déploiement industriel.

RecherchePaper
1 source
LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)
2arXiv cs.RO 

LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)

Des chercheurs ont publié LIBERO-Safety, un benchmark paramétrique conçu pour évaluer la sûreté physique et sémantique des modèles Vision-Language-Action (VLA) dans des scénarios de manipulation robotique. Le système génère de façon procédurale des situations critiques avec une stochasticité complète, en s'appuyant sur un pipeline de génération de données piloté par des poses-clés (keypose-driven), une alternative à la téléopération humaine, jugée trop coûteuse à passer à l'échelle. Le jeu de données résultant comprend 19 664 démonstrations strictement sans collision, avec une randomisation de domaine extensive. L'équipe a ensuite évalué de manière systématique huit modèles VLA et deux modèles fondateurs incarnés (embodied foundation models), couvrant plusieurs paradigmes d'entraînement contemporains. Le résultat central est une tension generalization-safety que les auteurs qualifient de critique : un entraînement sur des données très diversifiées produit des trajectoires plus sûres, mais la réussite des tâches reste fondamentalement plafonnée par une synthèse de trajectoires sous-optimale et un désalignement sémantique. Autrement dit, rendre un VLA plus prudent ne le rend pas automatiquement plus compétent, et inversement. Pour les intégrateurs industriels et les équipes produit qui espèrent déployer ces modèles en environnement non contrôlé, ce constat tempère les promesses des démonstrations récentes : les modèles VLA actuels ne garantissent pas une opération sûre sous contraintes strictes. C'est un signal fort que les métriques de performance sur tâche sont insuffisantes pour valider un déploiement réel. LIBERO-Safety s'inscrit dans la continuité du benchmark LIBERO (Lifelong Robot Learning), initialement développé pour évaluer le transfert de tâches. L'extension safety arrive dans un contexte d'accélération marquée des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont tous été présentés cette année avec des capacités de manipulation généraliste convaincantes, mais sans évaluation de sûreté systématisée. LIBERO-Safety propose une infrastructure open-source pour combler ce vide, avec un pipeline scalable permettant à d'autres équipes de générer leurs propres datasets de sécurité. Les suites naturelles incluent l'intégration de ce benchmark dans les pipelines d'évaluation des grands labos de robotique, et potentiellement son adoption comme référentiel de validation pour des déploiements industriels en production.

RecherchePaper
1 source
LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action
3arXiv cs.RO 

LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action

Un benchmark baptisé LIBERO-VIFO, décrit dans un article arXiv (2608.17600v1) publié comme nouvelle soumission, évalue pour la première fois de façon systématique deux dimensions distinctes des modèles Vision-Language-Action (VLA) : leur capacité à suivre des indices visuels autorisés, et le risque qu'ils suivent des indices visuels non autorisés. Le benchmark définit huit familles de signaux visuels couvrant des formes variées, et structure l'évaluation en quatre protocoles répartis en deux parties. La première partie mesure la compréhension du signal et son exécution correcte lorsqu'il est autorisé. La seconde partie teste ce qui se passe en cas de conflit entre l'instruction en langage naturel et le signal visuel, ainsi qu'en l'absence totale d'instruction verbale. Sept modèles VLA ont été évalués sur ce protocole, complété par des expériences additionnelles sur des scènes instanciées, des configurations jugées critiques pour la sécurité, et un déploiement sur robot réel. Le résultat central est double et contre-intuitif : comprendre un indice visuel ne garantit pas qu'un modèle VLA l'exécute correctement, mais à l'inverse, plusieurs modèles se sont montrés capables d'exécuter une tâche indiquée uniquement par un signal visuel, sans aucune instruction linguistique associée. Cela révèle un angle mort de sécurité resté largement ignoré jusqu'ici : la plupart des benchmarks existants traitent implicitement tout indice visuel comme légitime et ne mesurent que le succès final de la tâche, sans distinguer suivi autorisé et non autorisé. Pour les intégrateurs et décideurs déployant des robots pilotés par VLA en environnement partagé (usine, entrepôt, espace public), cela signifie qu'un marqueur, objet ou geste placé dans la scène par un tiers non habilité pourrait suffire à déclencher une action, en dehors de tout contrôle par instruction verbale. Cela nuance l'hypothèse selon laquelle le canal langage resterait le point de contrôle sûr et unique des architectures VLA. Les auteurs justifient LIBERO-VIFO par les limites des travaux antérieurs, cantonnés à un éventail restreint de formes d'indices et à une évaluation grossière fondée sur le seul succès de tâche, sans jamais interroger la légitimité du signal suivi. Le nom du benchmark suggère un ancrage dans la suite existante LIBERO, utilisée pour l'apprentissage de politiques de manipulation robotique. En couvrant à la fois capacité et sécurité du suivi de signaux visuels, et en confirmant ses constats jusque sur robot réel, ce travail entend établir la "sécurité centrée sur le visuel" comme nouvel axe d'évaluation pour la communauté VLA, aux côtés des travaux déjà existants sur les vulnérabilités liées au langage. Il s'agit à ce stade d'un benchmark académique et non d'un produit ou d'un déploiement industriel.

RechercheActu
1 source
VLA-Arena : un cadre open source pour évaluer les modèles vision-langage-action (VLA)
4arXiv cs.RO 

VLA-Arena : un cadre open source pour évaluer les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié VLA-Arena, un framework open-source de benchmark conçu pour évaluer les modèles Vision-Language-Action (VLA), ces politiques robotiques généralisées capables d'interpréter commandes en langage naturel et observations visuelles pour générer des actions motrices. La version 2 du preprint (arXiv 2512.22539v2) présente un protocole structuré autour de 170 tâches, organisées selon quatre dimensions orthogonales : sécurité (Safety), gestion des distracteurs (Distractor), extrapolation hors-distribution (Extrapolation) et planification longue portée (Long Horizon). Chaque tâche existe en trois niveaux de difficulté (L0 à L2), le fine-tuning étant exclusivement réalisé sur L0 afin de tester la capacité de généralisation. En parallèle, des perturbations linguistiques (W0-W4) et visuelles (V0-V4) s'appliquent indépendamment à chaque tâche, permettant une analyse découplée de la robustesse. Les auteurs publient également les datasets VLA-Arena-S/M/L ainsi qu'un leaderboard public. Les résultats de l'évaluation des VLA de l'état de l'art sont sévères et contre-intuitifs pour ceux qui suivent les démonstrations marketing du secteur. Les modèles testés exhibent une forte tendance à la mémorisation plutôt qu'à la généralisation réelle : leurs performances s'effondrent dès que la tâche sort légèrement de la distribution d'entraînement. La robustesse est asymétrique selon l'axe perturbé (visuel vs. linguistique), les contraintes de sécurité sont quasi-ignorées, et la composition de compétences pour les tâches longue portée reste hors de portée de tous les modèles testés. Pour les intégrateurs industriels et les équipes R&D qui envisagent de déployer des VLA en production, ces résultats constituent un signal d'alerte : le "sim-to-real gap" n'est pas résolu, et les capacités affichées en démo ne tiennent pas face à des conditions réelles variables. VLA-Arena arrive dans un contexte de prolifération rapide des VLA généralistes : Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Google DeepMind (RT-2, Gemini Robotics) et OpenVLA font tous état de progrès importants, mais sur des benchmarks hétérogènes et souvent propriétaires, rendant toute comparaison directe impossible. L'absence d'un protocole d'évaluation standardisé est depuis longtemps identifiée comme le principal obstacle à la progression scientifique rigoureuse du domaine. VLA-Arena n'est pas encore un standard industriel adopté, mais sa publication en open-source avec toolchain complet (définition de tâche, évaluation automatisée, datasets) le positionne comme candidat sérieux. Les prochaines étapes dépendront de l'adoption par les équipes qui développent ces modèles, et d'une éventuelle intégration dans les pipelines de validation avant déploiement réel en atelier.

RechercheOpinion
1 source