Refus qui fléchissent : mesurer et prédire la malléabilité des tâches dans les planificateurs VLM incarnés
Des chercheurs publient sur arXiv (2609.38971) une étude sur la robustesse des refus de sécurité des VLM (vision-language models) utilisés comme planificateurs de haut niveau pour robots. Le test est simple: placer un seul objet du quotidien dans l'environnement, sans pixel, gradient ni prompt sous contrôle adversarial. Sur 846 tâches qu'un planificateur protégé par une « constitution » (règles de sécurité explicites) refusait initialement, 20,2 % basculent vers l'acceptation avec un ou plusieurs objets, et le nombre d'objets nécessaires varie d'une tâche à l'autre. L'objet n'a pas besoin d'être choisi pour la tâche: des objets tirés d'une liste fixe, sans connaissance de l'environnement ni de l'instruction, contournent la sécurité presque aussi souvent que ceux proposés spécifiquement. Les auteurs prédisent aussi cette vulnérabilité: un score composite de signaux extraits d'un petit VLM open source identifie les tâches « malléables » 2,4 fois plus souvent qu'un tirage aléatoire, sans interroger la cible.
Ce résultat déplace le problème. Les red-teamings existants supposent un attaquant qui optimise le prompt, l'image ou un texte dans la scène, et les benchmarks mesurent si un modèle reconnaît un danger dans une scène figée. Ici, aucun adversaire n'est requis: un simple réarrangement ordinaire de l'environnement peut suffire à lever un refus. Pour un intégrateur, cela contredit l'hypothèse selon laquelle un alignement validé en laboratoire se transfère à des sites inconnus, alors que l'intérêt des VLM planificateurs est justement leur généralisation. L'analyse qualitative indique que la fragilité dépend de la visibilité du danger dans l'instruction et la scène: les tâches dont le risque est peu évident sont les plus contournées. La vulnérabilité est donc une propriété de la tâche, pas seulement du modèle. Les auteurs recommandent d'évaluer cette « malléabilité » tâche par tâche avant déploiement.
Il faut nuancer: il s'agit d'un préprint non évalué par les pairs, mesuré sur un seul type de garde-fou (constitutionnel) et sans que le résumé précise les modèles testés, ni si l'étude a eu lieu en simulation ou sur matériel réel. Le taux de 20,2 % porte sur des tâches déjà refusées, pas sur l'ensemble des requêtes. Le travail s'inscrit dans la montée des architectures où un VLM planifie et des politiques bas niveau exécutent, popularisées par les approches VLA et les modèles de fondation robotiques, et il prolonge les travaux d'attaques adversariales sur ces planificateurs en les remplaçant par des perturbations réalistes. L'étape suivante logique est l'intégration de tests de malléabilité dans les audits de sécurité avant mise en service, notamment pour les déploiements en environnements non contrôlés.
Dans nos dossiers




