GUARD : détection de risque par ancrage d'incertitude et ablation pour les VLA à diffusion
Une équipe de recherche publie GUARD (Grounding Uncertainty and Ablation-based Risk Detection), une méthode de détection d'échec en temps de test pour les politiques VLA (vision-langage-action) fondées sur la diffusion, sans modifier le modèle préentraîné. Le principe consiste à mesurer l'influence des entrées indexées par token dans le cache clé-valeur (KV) du modèle vision-langage, à construire des caches contrefactuels en supprimant les entrées KV les plus saillantes, puis à comparer les réponses de débruitage obtenues avec le conditionnement original. GUARD en tire un flux de diagnostics, sensibilité, entropie d'attention, biais de modalité et efficacité de l'ancrage, calibrés en ligne et traités par un classifieur temporel léger. La méthode est testée sur cinq combinaisons politique-benchmark : les modèles Pi0 (Physical Intelligence), SmolVLA (Hugging Face) et Alpamayo-1.5 (Nvidia), évalués sur les bancs d'essai LIBERO, SimplerEnv, MetaWorld et PhysicalAI-AV, avec des tâches jamais vues à l'entraînement. GUARD obtient le meilleur score ROC-AUC sur quatre des cinq configurations de tâches inédites et se classe deuxième sur la dernière, avec un gain moyen de 5,73 points de pourcentage sur le meilleur moniteur concurrent, tout en restant à 0,19 point du meilleur résultat obtenu sur des tâches déjà vues.
Ce travail s'attaque à un problème concret pour quiconque déploie des politiques VLA en robotique : ces modèles génèrent des actions plausibles même quand leur perception de la tâche est mal ancrée dans l'image ou la consigne textuelle, ce qui produit des échecs silencieux difficiles à anticiper avant exécution. Pour les intégrateurs qui évaluent des VLA génératifs comme Pi0 ou GR00T pour du pick-and-place, de la manipulation ou de la conduite autonome, disposer d'un signal d'alerte transférable d'une tâche à l'autre, d'une politique à l'autre et d'un robot à l'autre change la donne : un tel signal permettrait de déclencher un arrêt ou une intervention humaine avant qu'une action erronée ne soit exécutée, plutôt que de constater l'échec après coup. C'est aussi une réponse indirecte à un doute récurrent du secteur sur les VLA à diffusion : leur fluidité gestuelle masque parfois un raisonnement multimodal fragile, et GUARD propose d'auditer ce raisonnement interne plutôt que de se fier au seul comportement observé en sortie.
GUARD s'inscrit dans une littérature croissante de moniteurs d'exécution pour politiques robotiques génératives, portée par l'essor rapide des VLA depuis des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, déployés ou testés sur des plateformes humanoïdes et des bras manipulateurs. La méthode se positionne face aux approches existantes de détection d'anomalie en temps réel, qu'elle surpasse en moyenne sur des tâches inédites tout en restant compétitive sur des tâches connues, un compromis généralisation-précision central pour toute solution visée à la production. Les auteurs évaluent leur approche exclusivement en simulation et sur des jeux de données benchmark (LIBERO, SimplerEnv, MetaWorld, PhysicalAI-AV), sans validation sur robot physique à ce stade : cette publication arXiv relève donc de la recherche amont plutôt que d'un outil prêt à déployer, et une vérification en conditions réelles reste l'étape naturelle avant toute intégration industrielle.
Dans nos dossiers




