IMPACT-VLA : attribution de propagation multimodale sensible aux interactions via trajectoires contrefactuelles pour VLA
Des chercheurs ont présenté fin 2026 IMPACT-VLA, une méthode d'attribution pour les politiques Vision-Language-Action (VLA), documentée dans un article publié sur arXiv sous la référence 2609.15005. L'outil vise à déterminer à quel moment de l'exécution d'une tâche de manipulation robotique chaque modalité d'entrée, image, état proprioceptif ou instruction en langage naturel, contribue réellement au succès final. La méthode découpe une trajectoire de référence réussie en phases comportementales définies par les transitions d'action, aligne ces phases sur les frontières de requête de la politique, puis ré-exécute le modèle en boucle fermée avec des interventions contrefactuelles sur des blocs phase-modalité. Testée sur 30 tâches de manipulation du benchmark LIBERO avec le modèle OpenVLA-OFT, elle montre que la modalité dominante change en cours de tâche dans 25 cas sur 30, soit 83,3%. Elle révèle aussi que les gains marginaux des blocs tardifs, pour des paires de modalités en interaction négative, augmentent d'environ 3,3 fois lorsque l'entrée est remplacée en phase précoce.
Ce travail s'attaque à un angle mort connu des systèmes VLA qui alimentent la nouvelle génération de robots manipulateurs, à commencer par OpenVLA, mais aussi des familles comme Pi-0, GR00T N2 ou Helix: les méthodes d'explicabilité existantes mesurent une sensibilité locale ou une importance moyennée dans le temps, sans capturer les dépendances entre phases. Les auteurs montrent que leur attribution en boucle fermée identifie l'information critique plus fidèlement qu'une simple perturbation statique de l'action, et surtout qu'une récupération fonctionnelle du robot peut survenir sans récupération comportementale visible, une distinction utile pour les équipes qui évaluent la robustesse réelle d'un pipeline de manipulation avant déploiement, au-delà des métriques de taux de succès brutes.
Le travail reste à ce stade une contribution académique en simulation, validée uniquement sur le banc d'essai LIBERO et un seul modèle, OpenVLA-OFT, sans démonstration sur robot physique ni chiffres de déploiement industriel. Il s'inscrit dans la lignée des travaux d'interprétabilité pour les architectures VLA combinant préentraînement vision-langage et génération d'action, et ouvre la voie à une extension vers d'autres modèles et vers des essais en conditions réelles.
Dans nos dossiers




