Filtrage de sécurité multi-liens pour les politiques VLA autour d'obstacles mobiles
Une politique vision-langage-action (VLA) peut mener à bien une tâche de manipulation tout en renversant des objets sans rapport avec elle, si bien que le taux de réussite seul ne dit rien de la sécurité en environnement encombré. Une équipe publiant sur arXiv propose un « bouclier » sans entraînement, qui s'ajoute à une politique VLA préentraînée sans la réentraîner. Il protège le gripper, le poignet et l'avant-bras avec cinq ellipsoïdes, et filtre chaque mouvement commandé par un seul programme de barrière, face à un ellipsoïde d'exclusion ajusté à partir d'une image RGB-D au reset. Un flux optique épars déplace ensuite le centre de cet ellipsoïde avec le danger, sans nouvelle détection ni nouvel ajustement. Sur six conditions simulées de mouvement du danger, la collision passe de 65,62 % à 27,27 % et le « safe-success » (tâche accomplie sans collision) de 29,35 % à 50,43 %. Sur matériel embarqué hétérogène, la barrière à cinq ellipsoïdes tourne sur CPU en 2,2 ms au 99e centile. L'élagage du préfixe vision-langage et la réduction des étapes de flow matching ramènent chaque appel à la politique π0.5 de 343 à 177,3 ms sur GPU intégré. Sur un bras physique SO-101, quatre tâches : le bras a touché le danger dans 3 épisodes protégés sur 16, contre 11 sur 16 sans bouclier.
L'intérêt tient à ce que ce travail s'attaque à un angle mort de l'évaluation des VLA : les benchmarks mesurent la complétion de tâche, pas les dégâts collatéraux, et un taux de réussite élevé peut masquer un comportement inacceptable dans un atelier ou une cuisine réels. Le résultat montre aussi qu'une couche de sécurité peut s'ajouter à un modèle figé, ce qui évite de reprendre un entraînement coûteux, et qu'elle tient dans le budget de calcul d'un système embarqué. Les ablations indiquent que protéger uniquement l'effecteur final est insuffisant, et que le suivi du danger récupère l'essentiel de la protection perdue quand son estimation reste figée au reset. Pour un intégrateur, c'est un argument concret en faveur de filtres de sécurité modulaires plutôt que d'une sécurité « apprise » dans la politique.
Il faut toutefois relativiser. Une collision résiduelle de 27 % en simulation reste élevée pour un déploiement industriel, et l'essai réel ne porte que sur 16 épisodes par condition, un échantillon trop mince pour une conclusion statistique ferme. Le danger y est modélisé par un seul ellipsoïde, ce qui limite la portée face à des obstacles multiples ou déformables. Ces résultats s'inscrivent dans la lignée des fonctions de barrière de contrôle (CBF) appliquées à la manipulation, désormais greffées sur des politiques génératives comme π0.5 de Physical Intelligence. Le SO-101, bras open source à bas coût issu de l'écosystème LeRobot de Hugging Face, rend l'approche reproductible par de petites équipes. La suite logique serait une validation sur des bras industriels et des obstacles multiples, sans calendrier annoncé.
Pas d\'impact direct sur la France/UE




