Aller au contenu principal
RecherchearXiv cs.RO 

WBAG : un cadre de sécurité corps entier et géométrie attachée pour la manipulation par modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent WBAG, un cadre de sécurité appliqué à l'inférence pour les politiques vision-langage-action (VLA), publié sur arXiv (2610.01083) en octobre 2026. Le système modélise le corps entier du robot articulé ainsi que la géométrie de l'objet saisi. Il construit un « ensemble sûr » conditionné par la saisie, dont la géométrie protégée s'adapte dès qu'un objet est attrapé. Cette géométrie évolutive est convertie en contraintes différentiables de type CBF (control barrier functions, fonctions barrières de contrôle). Ces contraintes modifient le moins possible l'action native à six dimensions en espace opérationnel produite par le VLA, afin d'éviter les collisions entre le robot, la scène et l'objet transporté. Les tests portent sur SafeLIBERO, une variante du benchmark LIBERO enrichie d'obstacles. Avec un évaluateur qui surveille tous les objets non liés à la tâche, WBAG atteint 97,38 % de Scene Safety agrégée et 59,38 % de Safe Success. Ce serait le meilleur score global parmi les méthodes comparées. Il s'agit d'un travail académique évalué en simulation, sans produit ni déploiement réel annoncé.

L'intérêt tient à la lacune que le travail cible. Les politiques VLA généralisent bien en manipulation, mais leur passage en conditions réelles bute sur le risque de collision. Les garde-fous existants à l'inférence raisonnent surtout à partir d'une représentation simplifiée centrée sur l'effecteur terminal. Ils ignorent donc les coudes, les segments du bras et le volume de la pièce tenue, qui changent la zone d'encombrement à chaque saisie. Pour un intégrateur, c'est un point concret : un robot qui frôle une étagère avec son avant-bras ou avec une boîte transportée n'est pas déployable, même si sa politique réussit la tâche en démonstration. L'écart entre les deux chiffres est aussi instructif. Le taux de réussite à la fois sûre et complète n'atteint que 59,38 %, loin des 97 % de sécurité. Le goulot d'étranglement n'est donc pas résolu, car éviter les collisions ne suffit pas à finir la tâche. Ces résultats reposent en outre sur un évaluateur choisi par les auteurs, dans un benchmark de simulation, et ne disent rien du transfert sim-to-real.

Le travail s'inscrit dans la recherche de sécurité « plug-in » pour des modèles de fondation de type Pi-0 ou GR00T, que l'on ne peut pas réentraîner à chaque nouvel environnement. Les CBF servent de filtre léger posé sur la politique, sans modifier ses poids. Reste à voir si WBAG sera validé sur robot physique, avec perception imparfaite et latence réelle, et s'il sera comparé sur d'autres benchmarks que LIBERO. Aucun acteur industriel ni pilote n'est cité dans le résumé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique
1arXiv cs.RO 

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique

VistaVLA, présenté dans un article arXiv publié le 15 juillet 2026, est un nouveau framework de manipulation robotique combinant vision, langage et action (VLA) qui construit une représentation 3D explicite de la scène à partir de primitives de Gaussiennes 3D. Contrairement aux modèles VLA classiques qui projettent directement instructions textuelles et images 2D vers des actions, VistaVLA fonctionne en deux étapes : il élève des caractéristiques vision-langage multi-vues en primitives gaussiennes 3D, créant des tokens sémantiques ancrés géométriquement, puis les compresse via un mécanisme baptisé Merge-then-Query (MtQ). Ce module réduit de 99% le nombre de tokens nécessaires tout en préservant les informations spatiales et sémantiques utiles à l'action. Les auteurs rapportent des gains de 22,8% du taux de réussite sur sept tâches réelles, et de 30% par rapport à la baseline VLA-Adapter sur des tâches hors distribution (out-of-distribution), en environnement simulé comme réel. Pour l'industrie robotique, ce travail cible un point faible connu des modèles VLA actuels : leur absence de représentation 3D persistante et invariante au point de vue, qui limite leur capacité à raisonner sur des contraintes géométriques et des layouts spatiaux complexes. La plupart des VLA en production s'appuient sur des flux caméra 2D bruts ou des cartes de profondeur peu structurées ; VistaVLA propose une carte cognitive 3D sémantique inspirée de la cognition humaine, un argument qui, s'il se confirme à plus grande échelle, pourrait influencer la conception des prochaines générations de politiques d'action pour bras manipulateurs et robots mobiles. Ce travail s'inscrit dans une vague de recherche académique cherchant à combler l'écart entre modèles VLA à succès commercial, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, et leurs limites documentées en generalisation spatiale. Les résultats restent pour l'instant issus d'évaluations contrôlées en laboratoire, sans déploiement industriel annoncé ; la validation sur des tâches de manipulation plus variées et à plus grande échelle reste la prochaine étape naturelle pour ce type d'approche.

RechercheActu
1 source
Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique
2arXiv cs.RO 

Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique

Des chercheurs présentent Safe-Night VLA, un framework de manipulation robotique qui ajoute la perception thermique infrarouge longue longueur d'onde à un modèle vision-langage-action (VLA) pré-entraîné, publié en version corrigée sur arXiv (2603.05754v2). Contrairement aux VLA classiques qui reposent uniquement sur des caméras RGB, ce système fait remonter un raisonnement sémantique fondé sur les propriétés thermodynamiques des objets et des surfaces, ce qui lui permet de percevoir des signaux invisibles pour une caméra couleur standard. Pour limiter la fragilité connue des politiques génératives face à des scénarios hors distribution d'entraînement, les auteurs ajoutent un filtre de sécurité basé sur des fonctions de barrière de contrôle (control barrier functions), garantissant un respect déterministe des contraintes de l'espace de travail pendant l'exécution. Les tests ont été menés sur un bras manipulateur Franka, avec un protocole d'évaluation inédit combinant manipulation conditionnée par la température, localisation de cibles sous une surface opaque, et désambiguïsation de reflets visuels. Résultat annoncé: le système surpasse les baselines RGB seules sur ces trois tâches, tout en maintenant l'exécution sous contrainte de sécurité. L'intérêt pour l'industrie tient moins à la démo qu'au principe qu'elle teste: peut-on faire dire à un modèle fondation pré-entraîné sur du RGB des choses pertinentes sur une modalité physique qu'il n'a jamais vue à l'entraînement, simplement en injectant un flux thermique dans son backbone vision-langage. Si ce principe se généralise, cela ouvre la voie à des VLA capables de manipuler dans le noir, de détecter des objets chauds ou cachés sous une surface, ou de distinguer un vrai objet d'un reflet trompeur, des cas d'usage utiles en logistique nocturne, en environnements industriels à faible visibilité ou en inspection. L'ajout d'un filtre de sécurité formel plutôt que purement appris répond aussi à une critique récurrente des politiques VLA end-to-end: l'absence de garanties dures sur les collisions ou les dépassements de zone de travail, un point sensible pour tout déploiement en environnement partagé avec des humains. Le travail s'inscrit dans la vague actuelle des VLA généralistes (type GR00T N2, Pi-0, Helix) qui cherchent à étendre la perception au-delà du RGB pour combler l'écart entre démonstrations en laboratoire et robustesse réelle. Il reste à ce stade une validation académique sur un seul bras fixe en conditions contrôlées, sans indication de déploiement industriel ni de partenaire commercial, et les auteurs eux-mêmes ne revendiquent qu'une preuve de concept sur l'exploitation de modalités physiques non visibles.

RecherchePaper
1 source
LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)
3arXiv cs.RO 

LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)

Des chercheurs ont publié LIBERO-Safety, un benchmark paramétrique conçu pour évaluer la sûreté physique et sémantique des modèles Vision-Language-Action (VLA) dans des scénarios de manipulation robotique. Le système génère de façon procédurale des situations critiques avec une stochasticité complète, en s'appuyant sur un pipeline de génération de données piloté par des poses-clés (keypose-driven), une alternative à la téléopération humaine, jugée trop coûteuse à passer à l'échelle. Le jeu de données résultant comprend 19 664 démonstrations strictement sans collision, avec une randomisation de domaine extensive. L'équipe a ensuite évalué de manière systématique huit modèles VLA et deux modèles fondateurs incarnés (embodied foundation models), couvrant plusieurs paradigmes d'entraînement contemporains. Le résultat central est une tension generalization-safety que les auteurs qualifient de critique : un entraînement sur des données très diversifiées produit des trajectoires plus sûres, mais la réussite des tâches reste fondamentalement plafonnée par une synthèse de trajectoires sous-optimale et un désalignement sémantique. Autrement dit, rendre un VLA plus prudent ne le rend pas automatiquement plus compétent, et inversement. Pour les intégrateurs industriels et les équipes produit qui espèrent déployer ces modèles en environnement non contrôlé, ce constat tempère les promesses des démonstrations récentes : les modèles VLA actuels ne garantissent pas une opération sûre sous contraintes strictes. C'est un signal fort que les métriques de performance sur tâche sont insuffisantes pour valider un déploiement réel. LIBERO-Safety s'inscrit dans la continuité du benchmark LIBERO (Lifelong Robot Learning), initialement développé pour évaluer le transfert de tâches. L'extension safety arrive dans un contexte d'accélération marquée des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont tous été présentés cette année avec des capacités de manipulation généraliste convaincantes, mais sans évaluation de sûreté systématisée. LIBERO-Safety propose une infrastructure open-source pour combler ce vide, avec un pipeline scalable permettant à d'autres équipes de générer leurs propres datasets de sécurité. Les suites naturelles incluent l'intégration de ce benchmark dans les pipelines d'évaluation des grands labos de robotique, et potentiellement son adoption comme référentiel de validation pour des déploiements industriels en production.

RecherchePaper
1 source
SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action
4arXiv cs.RO 

SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action

Une équipe de recherche présente SafeStage, un benchmark structuré en trois étapes pour évaluer la sécurité des politiques de manipulation robotique conditionnées par le langage et la vision (VLA), publié sur arXiv (arXiv:2609.21223v1) en septembre 2026. L'outil comprend 97 scénarios de risque conçus spécifiquement pour tester trois phases du cycle de manipulation : les « dangers d'état initial » (relations spatiales ou physiques à résoudre avant de toucher à l'objet cible), la « sécurité pendant l'exécution » (contacts non intentionnels, trajectoires dangereuses, entrées dans des zones interdites, interactions non voulues avec d'autres objets) et les « dangers d'état final » (conditions instables ou dangereuses subsistant après l'achèvement nominal de la tâche). Le benchmark combine des vérifications basées sur les événements et sur l'état du système, et rapporte le taux de succès de la tâche indépendamment des résultats de sécurité propres à chaque étape. Les chercheurs ont testé des politiques VLA à action directe représentatives ainsi que des politiques s'appuyant sur des modèles du monde, dans un protocole commun en boucle fermée. Le résultat central est qu'une tâche accomplie avec succès coexiste fréquemment avec des violations de sécurité, et que les différentes politiques testées présentent des profils d'échec distincts selon l'étape du cycle concernée. Ce découplage entre succès de tâche et sécurité vient contredire une hypothèse implicite répandue dans le secteur, celle qu'un robot qui termine sa tâche l'a nécessairement fait de manière sûre. Pour les intégrateurs et décideurs industriels évaluant des politiques VLA généralistes en vue d'usages en ligne de production ou en environnement partagé avec des humains, SafeStage offre un outil de diagnostic permettant de localiser précisément quand et comment une politique échoue en matière de sécurité, plutôt que de se fier à un simple taux de réussite de tâche ou à des tests isolés de refus sémantique. Ce constat arrive alors que la course aux politiques VLA généralistes, portée par des familles de modèles comme Pi-0, GR00T ou Helix dans l'écosystème plus large de la manipulation robotique, s'accélère sur la base de démonstrations souvent impressionnantes mais rarement soumises à une évaluation systématique de sécurité en boucle fermée. Ce travail répond à une lacune des benchmarks existants, généralement centrés soit sur le succès de tâche, soit sur des contraintes physiques isolées, soit sur le refus sémantique de commandes dangereuses, soit sur des dommages physiques déjà constatés après coup, sans permettre de localiser à quel moment précis du cycle de manipulation survient une violation. En proposant un banc d'essai unifié et diagnostique, les auteurs visent un outil réutilisable pour comparer et améliorer les politiques VLA à mesure qu'elles se rapprochent d'un déploiement industriel réel. Le papier ne mentionne ni partenariat commercial ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche académique destinée à la communauté robotique, sans acteur ni déploiement réel annoncé, ce qui la distingue nettement des communiqués marketing habituels du secteur des robots humanoïdes.

UECe benchmark académique n'implique aucun acteur français ou européen mais offre un outil générique que des intégrateurs robotiques européens pourraient utiliser pour évaluer la sécurité de politiques VLA avant déploiement industriel.

RecherchePaper
1 source