WBAG : un cadre de sécurité corps entier et géométrie attachée pour la manipulation par modèles vision-langage-action (VLA)
Des chercheurs proposent WBAG, un cadre de sécurité appliqué à l'inférence pour les politiques vision-langage-action (VLA), publié sur arXiv (2610.01083) en octobre 2026. Le système modélise le corps entier du robot articulé ainsi que la géométrie de l'objet saisi. Il construit un « ensemble sûr » conditionné par la saisie, dont la géométrie protégée s'adapte dès qu'un objet est attrapé. Cette géométrie évolutive est convertie en contraintes différentiables de type CBF (control barrier functions, fonctions barrières de contrôle). Ces contraintes modifient le moins possible l'action native à six dimensions en espace opérationnel produite par le VLA, afin d'éviter les collisions entre le robot, la scène et l'objet transporté. Les tests portent sur SafeLIBERO, une variante du benchmark LIBERO enrichie d'obstacles. Avec un évaluateur qui surveille tous les objets non liés à la tâche, WBAG atteint 97,38 % de Scene Safety agrégée et 59,38 % de Safe Success. Ce serait le meilleur score global parmi les méthodes comparées. Il s'agit d'un travail académique évalué en simulation, sans produit ni déploiement réel annoncé.
L'intérêt tient à la lacune que le travail cible. Les politiques VLA généralisent bien en manipulation, mais leur passage en conditions réelles bute sur le risque de collision. Les garde-fous existants à l'inférence raisonnent surtout à partir d'une représentation simplifiée centrée sur l'effecteur terminal. Ils ignorent donc les coudes, les segments du bras et le volume de la pièce tenue, qui changent la zone d'encombrement à chaque saisie. Pour un intégrateur, c'est un point concret : un robot qui frôle une étagère avec son avant-bras ou avec une boîte transportée n'est pas déployable, même si sa politique réussit la tâche en démonstration. L'écart entre les deux chiffres est aussi instructif. Le taux de réussite à la fois sûre et complète n'atteint que 59,38 %, loin des 97 % de sécurité. Le goulot d'étranglement n'est donc pas résolu, car éviter les collisions ne suffit pas à finir la tâche. Ces résultats reposent en outre sur un évaluateur choisi par les auteurs, dans un benchmark de simulation, et ne disent rien du transfert sim-to-real.
Le travail s'inscrit dans la recherche de sécurité « plug-in » pour des modèles de fondation de type Pi-0 ou GR00T, que l'on ne peut pas réentraîner à chaque nouvel environnement. Les CBF servent de filtre léger posé sur la politique, sans modifier ses poids. Reste à voir si WBAG sera validé sur robot physique, avec perception imparfaite et latence réelle, et s'il sera comparé sur d'autres benchmarks que LIBERO. Aucun acteur industriel ni pilote n'est cité dans le résumé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




