VLA-Scope : prédire les échecs des modèles vision-langage-action face aux changements de distribution
Un article publie sur arXiv (2609.21246v1) présente VLA-Scope, un framework en deux étapes qui prédit les échecs d'exécution des modèles vision-langage-action (VLA) quand les entrées s'écartent de la distribution d'entrainement, ou OOD. La première étape détecte les entrées OOD et classe leur type de décalage a partir de représentations poolees d'image et de texte; la seconde combine cette catégorie, le préfixe d'actions déjà jouées et la progression de la tache dans une régression logistique qui réactualisé le risque d'échec en continu. Teste avec OpenVLA sur dix taches du benchmark LIBERO-Spatial en validation croisée leave-one-group-out, le système atteint un ROC-AUC de 0,9454 pour la détection OOD et 91% de précision pour la classification des décalages. Sur les 1 400 exécutions OOD évaluées, le prédicteur d'échec obtient un ROC-AUC de 0,8497 après 60 actions, contre 0,7906 sans les indicateurs de progression, devançant les références ActProbe et SAFE-MLP.
L'enjeu pour l'industrie tient au constat de départ: un modèle VLA peut réussir même en conditions OOD, donc détecter un simple écart de distribution ne suffit pas a anticiper un échec, il faut aussi suivre le déroulement de l'exécution. Pour les intégrateurs déployant des politiques VLA sur des robots réels, confrontes en continu a des variations d'éclairage ou de pose d'objets, un signal de risque qui s'affine action après action ouvre la voie a des mécanismes de secours (arrêt, reprise humaine) sans capteur ni reentrainement supplémentaires. Le travail reste valide en simulation, sur un seul benchmark et un seul modèle: une preuve de concept, pas un outil de production.
OpenVLA, le modèle teste, appartient a la famille des politiques VLA open source qui côtoient des systèmes propriétaires comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, tous confrontes au même problème de fiabilité hors distribution. VLA-Scope se compare a deux méthodes existantes, ActProbe et SAFE-MLP, qu'il surpasse sur les métriques rapportées. L'article, classe comme nouvelle soumission sur arXiv sans auteurs ni calendrier précises, appelle logiquement une validation sur des taches plus variées, d'autres architectures et des robots physiques plutôt que des environnements simules.
Dans nos dossiers




