
Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution
Des chercheurs proposent SALT (Self-supervised Adaptation from Leftover Trajectories), une méthode d'adaptation au moment du test pour les modèles vision-langage-action (VLA), publiée sur arXiv (2610.07946). Elle cible un problème précis : une perturbation visuelle (corruption d'image, obstruction physique de la caméra) survient en cours d'exécution, sans que la politique connaisse son type ni son moment d'apparition. SALT exploite la « trajectoire résiduelle », c'est-à-dire la partie non exécutée du chunk d'actions précédent. Les chunks consécutifs se recouvrant dans le temps, ce résidu fournit une cible alignée sur le même intervalle de contrôle que la prédiction courante. Aucune annotation de perturbation, aucune action d'expert et aucune démonstration du domaine cible ne sont requises. Une porte d'adaptation légère, calibrée uniquement sur des trajectoires nominales, déclenche les mises à jour. Sur LIBERO-10, le taux de succès moyen sur cinq corruptions visuelles persistantes passe de 43,9 % à 53,2 % avec SmolVLA, et de 58,7 % à 66,0 % avec GR00T N1.7, avec une performance nominale largement préservée. Sur robot réel, la progression de tâche moyenne, perturbations numériques et physiques confondues, passe de 0,49 à 0,61.
L'intérêt tient à la nature du problème traité. La plupart des travaux de robustesse des VLA supposent un entraînement avec augmentation de données ou une connaissance du décalage de domaine. Or en production, caméras salies, éclairage changeant ou occultations partielles arrivent sans préavis. SALT suggère qu'on peut gagner entre 7 et 9 points de succès sans données supplémentaires, en recyclant les prédictions déjà produites par le modèle. Deux mécanismes expliquent l'effet : à l'apparition du décalage, le résidu garde un plan formé avant la corruption et sert d'ancre (Transition Anchoring), puis la correction se propage d'un replanning à l'autre (Sequential Correction Propagation). Les limites sont nettes : le gain reste modeste en valeur absolue, les taux de succès restent sous les 70 %, et le test sur robot réel, mesuré par un score de progression et non un taux de réussite, offre peu de détails sur le nombre d'essais ou les tâches. Le benchmark LIBERO reste de plus de la simulation.
Ce travail s'inscrit dans l'effort de fiabilisation des VLA après la vague de modèles généralistes comme Pi-0, GR00T ou SmolVLA, dont l'écart entre démonstration et déploiement tient souvent à la sensibilité aux conditions visuelles. L'approche rejoint l'adaptation au moment du test, déjà explorée en vision par ordinateur, mais l'applique ici à la structure par chunks d'actions propre aux politiques modernes. Elle reste un résultat de recherche, sans produit ni déploiement annoncé. Les prochaines étapes probables sont des validations sur d'autres architectures, des perturbations plus variées et des tâches longues, ainsi qu'une évaluation du coût de calcul des mises à jour en ligne sur du matériel embarqué, point que le résumé ne chiffre pas.
Dans nos dossiers




