Aller au contenu principal
LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action
RecherchearXiv cs.RO 

LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un benchmark baptisé LIBERO-VIFO, décrit dans un article arXiv (2608.17600v1) publié comme nouvelle soumission, évalue pour la première fois de façon systématique deux dimensions distinctes des modèles Vision-Language-Action (VLA) : leur capacité à suivre des indices visuels autorisés, et le risque qu'ils suivent des indices visuels non autorisés. Le benchmark définit huit familles de signaux visuels couvrant des formes variées, et structure l'évaluation en quatre protocoles répartis en deux parties. La première partie mesure la compréhension du signal et son exécution correcte lorsqu'il est autorisé. La seconde partie teste ce qui se passe en cas de conflit entre l'instruction en langage naturel et le signal visuel, ainsi qu'en l'absence totale d'instruction verbale. Sept modèles VLA ont été évalués sur ce protocole, complété par des expériences additionnelles sur des scènes instanciées, des configurations jugées critiques pour la sécurité, et un déploiement sur robot réel.

Le résultat central est double et contre-intuitif : comprendre un indice visuel ne garantit pas qu'un modèle VLA l'exécute correctement, mais à l'inverse, plusieurs modèles se sont montrés capables d'exécuter une tâche indiquée uniquement par un signal visuel, sans aucune instruction linguistique associée. Cela révèle un angle mort de sécurité resté largement ignoré jusqu'ici : la plupart des benchmarks existants traitent implicitement tout indice visuel comme légitime et ne mesurent que le succès final de la tâche, sans distinguer suivi autorisé et non autorisé. Pour les intégrateurs et décideurs déployant des robots pilotés par VLA en environnement partagé (usine, entrepôt, espace public), cela signifie qu'un marqueur, objet ou geste placé dans la scène par un tiers non habilité pourrait suffire à déclencher une action, en dehors de tout contrôle par instruction verbale. Cela nuance l'hypothèse selon laquelle le canal langage resterait le point de contrôle sûr et unique des architectures VLA.

Les auteurs justifient LIBERO-VIFO par les limites des travaux antérieurs, cantonnés à un éventail restreint de formes d'indices et à une évaluation grossière fondée sur le seul succès de tâche, sans jamais interroger la légitimité du signal suivi. Le nom du benchmark suggère un ancrage dans la suite existante LIBERO, utilisée pour l'apprentissage de politiques de manipulation robotique. En couvrant à la fois capacité et sécurité du suivi de signaux visuels, et en confirmant ses constats jusque sur robot réel, ce travail entend établir la "sécurité centrée sur le visuel" comme nouvel axe d'évaluation pour la communauté VLA, aux côtés des travaux déjà existants sur les vulnérabilités liées au langage. Il s'agit à ce stade d'un benchmark académique et non d'un produit ou d'un déploiement industriel.

À lire aussi

HazardArena : évaluer la sécurité sémantique des modèles vision-langage-action
1arXiv cs.RO 

HazardArena : évaluer la sécurité sémantique des modèles vision-langage-action

Un article publié sur arXiv (référence 2604.12447, version 2, mise à jour de la disponibilité du code) présente HazardArena, un benchmark conçu pour évaluer la sécurité sémantique des modèles Vision-Language-Action (VLA), ces systèmes qui pilotent des robots en combinant perception visuelle, compréhension du langage et exécution d'actions. Le jeu de données comprend plus de 2 000 assets et 40 tâches sensibles au risque, réparties en 7 catégories de danger réel calquées sur des normes de sécurité robotique établies. Sa spécificité tient à des paires de scénarios jumeaux, sûr et dangereux, qui partagent exactement les mêmes objets, la même disposition spatiale et les mêmes consignes d'action, et ne diffèrent que par le contexte sémantique déterminant si l'action devient risquée. Les auteurs montrent que des modèles VLA entraînés uniquement sur les versions sûres échouent fréquemment à ajuster leur comportement face aux scénarios dangereux correspondants, exécutant la tâche demandée sans tenir compte du risque contextuel. Pour y remédier, l'équipe propose une "Safety Option Layer", un module ajouté sans réentraînement du modèle, qui restreint l'exécution des actions à l'aide d'attributs sémantiques ou d'un juge vision-langage, réduisant nettement les comportements dangereux avec un impact limité sur la performance des tâches. Le code est publié sur GitHub, sous HazardArena-Team. Ce travail met en évidence une faille méthodologique dans la manière dont l'industrie évalue aujourd'hui les modèles VLA: la réussite d'une action ne garantit pas qu'elle soit exécutée en toute sécurité, car les politiques d'action restent faiblement couplées à la sémantique visuelle et linguistique du contexte. Pour les intégrateurs et décideurs qui déploient des robots pilotés par des modèles fondation en environnement réel, entrepôts, sites industriels ou domiciles, cela signifie que les benchmarks de performance actuels ne suffisent pas à garantir un comportement sûr face à des variations contextuelles subtiles. L'approche sans réentraînement proposée est notable car elle offre une voie de correction peu coûteuse, applicable a posteriori sur des modèles déjà entraînés, plutôt que d'exiger une refonte complète des pipelines d'apprentissage. HazardArena s'inscrit dans un mouvement plus large de scrutin critique des modèles VLA à mesure qu'ils passent des démonstrations en laboratoire à des déploiements réels, où la diversité des contextes rend les défaillances sémantiques plus probables qu'en environnement contrôlé. Les auteurs présentent leur travail comme un appel à repenser l'évaluation et l'application de la sécurité sémantique dans ces modèles à l'échelle, sans annoncer de partenariat industriel ni de déploiement commercial associé. Le code et les données étant publiés en accès ouvert, l'initiative vise avant tout la communauté de recherche en robotique et en IA embarquée, plutôt qu'un produit ou un pilote destiné à des clients.

RecherchePaper
1 source
SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action
2arXiv cs.RO 

SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action

Une équipe de recherche présente SafeStage, un benchmark structuré en trois étapes pour évaluer la sécurité des politiques de manipulation robotique conditionnées par le langage et la vision (VLA), publié sur arXiv (arXiv:2609.21223v1) en septembre 2026. L'outil comprend 97 scénarios de risque conçus spécifiquement pour tester trois phases du cycle de manipulation : les « dangers d'état initial » (relations spatiales ou physiques à résoudre avant de toucher à l'objet cible), la « sécurité pendant l'exécution » (contacts non intentionnels, trajectoires dangereuses, entrées dans des zones interdites, interactions non voulues avec d'autres objets) et les « dangers d'état final » (conditions instables ou dangereuses subsistant après l'achèvement nominal de la tâche). Le benchmark combine des vérifications basées sur les événements et sur l'état du système, et rapporte le taux de succès de la tâche indépendamment des résultats de sécurité propres à chaque étape. Les chercheurs ont testé des politiques VLA à action directe représentatives ainsi que des politiques s'appuyant sur des modèles du monde, dans un protocole commun en boucle fermée. Le résultat central est qu'une tâche accomplie avec succès coexiste fréquemment avec des violations de sécurité, et que les différentes politiques testées présentent des profils d'échec distincts selon l'étape du cycle concernée. Ce découplage entre succès de tâche et sécurité vient contredire une hypothèse implicite répandue dans le secteur, celle qu'un robot qui termine sa tâche l'a nécessairement fait de manière sûre. Pour les intégrateurs et décideurs industriels évaluant des politiques VLA généralistes en vue d'usages en ligne de production ou en environnement partagé avec des humains, SafeStage offre un outil de diagnostic permettant de localiser précisément quand et comment une politique échoue en matière de sécurité, plutôt que de se fier à un simple taux de réussite de tâche ou à des tests isolés de refus sémantique. Ce constat arrive alors que la course aux politiques VLA généralistes, portée par des familles de modèles comme Pi-0, GR00T ou Helix dans l'écosystème plus large de la manipulation robotique, s'accélère sur la base de démonstrations souvent impressionnantes mais rarement soumises à une évaluation systématique de sécurité en boucle fermée. Ce travail répond à une lacune des benchmarks existants, généralement centrés soit sur le succès de tâche, soit sur des contraintes physiques isolées, soit sur le refus sémantique de commandes dangereuses, soit sur des dommages physiques déjà constatés après coup, sans permettre de localiser à quel moment précis du cycle de manipulation survient une violation. En proposant un banc d'essai unifié et diagnostique, les auteurs visent un outil réutilisable pour comparer et améliorer les politiques VLA à mesure qu'elles se rapprochent d'un déploiement industriel réel. Le papier ne mentionne ni partenariat commercial ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche académique destinée à la communauté robotique, sans acteur ni déploiement réel annoncé, ce qui la distingue nettement des communiqués marketing habituels du secteur des robots humanoïdes.

UECe benchmark académique n'implique aucun acteur français ou européen mais offre un outil générique que des intégrateurs robotiques européens pourraient utiliser pour évaluer la sécurité de politiques VLA avant déploiement industriel.

RecherchePaper
1 source
LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation
3arXiv cs.RO 

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation

Des chercheurs ont publié LIBERO-PRO, une extension critique du benchmark LIBERO largement utilisé pour évaluer les modèles Vision-Language-Action (VLA). Disponible sur GitHub (Zxy-MLlab/LIBERO-PRO), le travail, présenté sous forme d'arXiv preprint (arXiv:2510.03827v2), soumet les VLA à des perturbations systématiques selon quatre axes : substitution des objets manipulés, variation des états initiaux, modification des instructions de tâche, et changement d'environnement. Résultat sans appel : les modèles actuels qui atteignent plus de 90 % de succès sur l'évaluation LIBERO standard s'effondrent à 0,0 % dans le cadre généralisé de LIBERO-PRO. Concrètement, un modèle continue d'exécuter une séquence de saisie même lorsque l'objet cible est remplacé par un objet sans rapport, et ses sorties restent inchangées face à des instructions corrompues ou composées de tokens aléatoires. Ce résultat est un signal d'alarme direct pour les équipes qui fondent leurs décisions de recherche ou de déploiement sur les classements LIBERO. Il démontre que les modèles VLA n'ont pas acquis de compréhension générale des tâches ni de perception réelle de l'environnement : ils mémorisent des séquences d'actions et des configurations spatiales vues à l'entraînement. Autrement dit, le gap sim-to-real et le problème de généralisation restent entiers, quelle que soit la performance affichée sur le benchmark. Pour les intégrateurs industriels ou les équipes robotique qui envisagent de déployer des politiques basées sur des VLA, cela signifie que les scores publiés ne sont pas des indicateurs fiables de robustesse opérationnelle. LIBERO, introduit pour standardiser l'évaluation des politiques manipulatrices en langage naturel, est devenu une référence de facto dans la communauté. Mais comme tout benchmark sur-exploité, il a progressivement favorisé l'overfitting plutôt que la généralisation. LIBERO-PRO s'inscrit dans une tendance plus large de remise en question des protocoles d'évaluation VLA, aux côtés d'initiatives comparables sur les benchmarks de navigation et de saisie. La prochaine étape logique serait l'adoption de LIBERO-PRO comme standard par les principaux groupes travaillant sur des modèles comme OpenVLA, Octo ou pi0 (Physical Intelligence), afin de permettre des comparaisons réellement équitables et de pousser le secteur vers des politiques robustes en conditions réelles.

RechercheOpinion
1 source
LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)
4arXiv cs.RO 

LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)

Des chercheurs ont publié LIBERO-Safety, un benchmark paramétrique conçu pour évaluer la sûreté physique et sémantique des modèles Vision-Language-Action (VLA) dans des scénarios de manipulation robotique. Le système génère de façon procédurale des situations critiques avec une stochasticité complète, en s'appuyant sur un pipeline de génération de données piloté par des poses-clés (keypose-driven), une alternative à la téléopération humaine, jugée trop coûteuse à passer à l'échelle. Le jeu de données résultant comprend 19 664 démonstrations strictement sans collision, avec une randomisation de domaine extensive. L'équipe a ensuite évalué de manière systématique huit modèles VLA et deux modèles fondateurs incarnés (embodied foundation models), couvrant plusieurs paradigmes d'entraînement contemporains. Le résultat central est une tension generalization-safety que les auteurs qualifient de critique : un entraînement sur des données très diversifiées produit des trajectoires plus sûres, mais la réussite des tâches reste fondamentalement plafonnée par une synthèse de trajectoires sous-optimale et un désalignement sémantique. Autrement dit, rendre un VLA plus prudent ne le rend pas automatiquement plus compétent, et inversement. Pour les intégrateurs industriels et les équipes produit qui espèrent déployer ces modèles en environnement non contrôlé, ce constat tempère les promesses des démonstrations récentes : les modèles VLA actuels ne garantissent pas une opération sûre sous contraintes strictes. C'est un signal fort que les métriques de performance sur tâche sont insuffisantes pour valider un déploiement réel. LIBERO-Safety s'inscrit dans la continuité du benchmark LIBERO (Lifelong Robot Learning), initialement développé pour évaluer le transfert de tâches. L'extension safety arrive dans un contexte d'accélération marquée des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont tous été présentés cette année avec des capacités de manipulation généraliste convaincantes, mais sans évaluation de sûreté systématisée. LIBERO-Safety propose une infrastructure open-source pour combler ce vide, avec un pipeline scalable permettant à d'autres équipes de générer leurs propres datasets de sécurité. Les suites naturelles incluent l'intégration de ce benchmark dans les pipelines d'évaluation des grands labos de robotique, et potentiellement son adoption comme référentiel de validation pour des déploiements industriels en production.

RecherchePaper
1 source