Aller au contenu principal
Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution
RecherchearXiv cs.RO 

Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent SALT (Self-supervised Adaptation from Leftover Trajectories), une méthode d'adaptation au moment du test pour les modèles vision-langage-action (VLA), publiée sur arXiv (2610.07946). Elle cible un problème précis : une perturbation visuelle (corruption d'image, obstruction physique de la caméra) survient en cours d'exécution, sans que la politique connaisse son type ni son moment d'apparition. SALT exploite la « trajectoire résiduelle », c'est-à-dire la partie non exécutée du chunk d'actions précédent. Les chunks consécutifs se recouvrant dans le temps, ce résidu fournit une cible alignée sur le même intervalle de contrôle que la prédiction courante. Aucune annotation de perturbation, aucune action d'expert et aucune démonstration du domaine cible ne sont requises. Une porte d'adaptation légère, calibrée uniquement sur des trajectoires nominales, déclenche les mises à jour. Sur LIBERO-10, le taux de succès moyen sur cinq corruptions visuelles persistantes passe de 43,9 % à 53,2 % avec SmolVLA, et de 58,7 % à 66,0 % avec GR00T N1.7, avec une performance nominale largement préservée. Sur robot réel, la progression de tâche moyenne, perturbations numériques et physiques confondues, passe de 0,49 à 0,61.

L'intérêt tient à la nature du problème traité. La plupart des travaux de robustesse des VLA supposent un entraînement avec augmentation de données ou une connaissance du décalage de domaine. Or en production, caméras salies, éclairage changeant ou occultations partielles arrivent sans préavis. SALT suggère qu'on peut gagner entre 7 et 9 points de succès sans données supplémentaires, en recyclant les prédictions déjà produites par le modèle. Deux mécanismes expliquent l'effet : à l'apparition du décalage, le résidu garde un plan formé avant la corruption et sert d'ancre (Transition Anchoring), puis la correction se propage d'un replanning à l'autre (Sequential Correction Propagation). Les limites sont nettes : le gain reste modeste en valeur absolue, les taux de succès restent sous les 70 %, et le test sur robot réel, mesuré par un score de progression et non un taux de réussite, offre peu de détails sur le nombre d'essais ou les tâches. Le benchmark LIBERO reste de plus de la simulation.

Ce travail s'inscrit dans l'effort de fiabilisation des VLA après la vague de modèles généralistes comme Pi-0, GR00T ou SmolVLA, dont l'écart entre démonstration et déploiement tient souvent à la sensibilité aux conditions visuelles. L'approche rejoint l'adaptation au moment du test, déjà explorée en vision par ordinateur, mais l'applique ici à la structure par chunks d'actions propre aux politiques modernes. Elle reste un résultat de recherche, sans produit ni déploiement annoncé. Les prochaines étapes probables sont des validations sur d'autres architectures, des perturbations plus variées et des tâches longues, ainsi qu'une évaluation du coût de calcul des mises à jour en ligne sur du matériel embarqué, point que le résumé ne chiffre pas.

À lire aussi

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)
1arXiv cs.RO 

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)

Des chercheurs proposent T³VF (Test-Time Training Visual Foresight VLA), une méthode d'adaptation à l'inférence publiée sur arXiv en mai 2025 (réf. 2605.08215). Les architectures Visual Foresight VLA, qui figurent parmi les plus performantes pour le contrôle de robots manipulateurs, fonctionnent en deux temps : elles prédisent d'abord une image future représentant l'état visuel attendu après l'action, puis génèrent la commande motrice à partir de cette prédiction. Cette dépendance en cascade crée une vulnérabilité double aux situations hors-distribution (OOD) : une prédiction visuelle dégradée corrompt directement la décision motrice en aval. T³VF exploite l'écart entre l'image future prédite et l'observation réellement reçue comme signal de supervision naturel, permettant au modèle de s'ajuster en continu pendant l'exécution, sans modification architecturale ni modules auxiliaires. Un mécanisme de filtrage adaptatif sélectionne les mises à jour pertinentes pour éviter la dérive par accumulation d'erreurs indiscriminée. Pour les équipes de déploiement, l'enjeu est direct : les VLA sont benchmarkés en laboratoire mais confrontés en production à des variations de scène (éclairage, textures, disposition des objets) rarement couvertes par les données d'entraînement. T³VF propose une adaptation sans annotation humaine ni nouvelle session d'entraînement, le robot se corrigeant à partir de ses propres observations, avec un surcoût d'inférence qualifié de modeste par les auteurs, une affirmation à vérifier selon les environnements cibles. Si les résultats se confirment à plus grande échelle, la méthode pourrait réduire les cycles de re-fine-tuning lors du passage en production, un poste de coût opérationnel significatif pour les intégrateurs industriels. Les VLA s'imposent depuis 2023 comme architecture dominante en manipulation robotique, portés par des modèles comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 de Physical Intelligence. Les variantes Visual Foresight, qui ajoutent une prédiction d'état futur avant l'action, ont montré des gains sur les tâches de précision, mais leur fragilité face aux shifts de distribution restait peu adressée dans la littérature. Ce travail s'inscrit dans un courant croissant de Test-Time Training (TTT) appliqué à la robotique, distinct du fine-tuning classique en ce qu'il n'exige aucune supervision externe. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné : ce pré-print académique ne décrit pas de produit ou de déploiement commercialisé associé.

RechercheOpinion
1 source
MixVLA : mélange adaptatif des informations non invariantes pour des modèles vision-langage-action (VLA) généralisables
2arXiv cs.RO 

MixVLA : mélange adaptatif des informations non invariantes pour des modèles vision-langage-action (VLA) généralisables

Des chercheurs publient sur arXiv (2610.02898) MixVLA, un cadre d'entraînement pour modèles Vision-Language-Action (VLA) qui vise à améliorer la généralisation zéro-shot en conditions hors distribution (OOD). Le principe repose sur un module baptisé Adaptive Mixing of Non-Invariant Information (AMI). Celui-ci mélange de façon stochastique les représentations « non invariantes », c'est-à-dire les facteurs propres à un environnement comme l'apparence, l'éclairage ou la texture. Les représentations mélangées sont ensuite fusionnées avec les représentations invariantes, liées à la structure de la tâche, pour prédire l'action finale. La méthode est dite agnostique au modèle : elle ne demande ni donnée OOD supplémentaire ni modification d'architecture. Les auteurs l'évaluent sur LIBERO, LIBERO-Plus, la suite de perturbations de RoboTwin et des tâches réelles, et affirment une meilleure robustesse zéro-shot sans perte de performance en domaine. Le résumé ne donne aucun chiffre, ni gain, ni nom de modèle de base, ni nombre d'essais réels. L'enjeu touche l'un des points faibles les mieux identifiés des VLA : leur fragilité dès que la scène s'écarte des données d'entraînement. Ces politiques tendent à s'appuyer sur des indices visuels parasites (fond, couleur, position de caméra) plutôt que sur la structure de la tâche, ce qui explique une part de l'écart entre démonstration et déploiement. Pour un intégrateur ou un responsable industriel, un gain obtenu par simple recette d'entraînement, sans nouvelle collecte de données ni changement d'architecture, serait précieux, car la collecte de téléopération reste l'un des postes de coût les plus lourds. Il faut toutefois rester prudent : sans résultats chiffrés, il est impossible de juger l'ampleur du gain, et les benchmarks de simulation, même perturbés, ne garantissent pas la robustesse en atelier. Le volet réel, dont l'ampleur n'est pas précisée, devra être examiné dans l'article complet. Ce travail s'inscrit dans une série de recherches sur la robustesse des VLA. LIBERO-Plus et la suite de perturbations de RoboTwin ont été conçus pour exposer la sensibilité de ces modèles aux variations de caméra, d'éclairage, d'objets ou de langage, après que les scores quasi saturés sur LIBERO standard ont montré leurs limites. MixVLA se rapproche des techniques de régularisation et d'augmentation de représentations issues de la généralisation de domaine, ici transposées aux VLA. Il reste à voir s'il se montre complémentaire des grands modèles généralistes comme Pi-0 ou GR00T, et si le code et les poids sont publiés pour permettre une reproduction indépendante. Il s'agit d'une prépublication v1, non évaluée par des pairs, qui relève de la recherche et non d'un produit livré ou d'un déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèles vision-langage-action : superviser les VLA au-delà des actions physiques
3arXiv cs.RO 

Modèles vision-langage-action : superviser les VLA au-delà des actions physiques

Une équipe de recherche propose UVT (Unified Visuomotor Target), une méthode d'entraînement pour les modèles vision-langage-action (VLA), détaillée dans un article déposé sur arXiv en août 2026 (2608.03563v1). Le point de départ : les VLA sont entraînés à prédire directement des commandes moteur bas niveau à partir d'observations visuelles et de langage, alors que les modèles vision-langage sous-jacents encodent des représentations riches et de haut niveau des scènes et des objectifs, un décalage qui freine l'apprentissage. UVT introduit une cible latente unique encodant conjointement le contrôle moteur et la transition visuelle de la scène, sans modifier l'architecture ni ajouter de données. Testée sur deux systèmes VLA représentatifs, en simulation comme sur des tâches réelles de manipulation bimanuelle, elle améliore l'efficacité d'entraînement, la performance finale et la robustesse de la politique, avec des gains marqués sous budget d'entraînement limité ou en conditions difficiles. Pour l'industrie robotique, ce travail touche un point de friction bien identifié : la difficulté à obtenir des politiques VLA robustes sans volumes massifs de démonstrations téléopérées, coûteuses à collecter. En montrant qu'un simple changement de cible d'entraînement, sans toucher à l'architecture ni au volume de données, améliore l'efficacité et la robustesse, UVT s'inscrit dans une tendance cherchant à mieux exploiter l'information déjà présente dans les modèles vision-langage préentraînés plutôt que d'empiler paramètres ou données. Pour les équipes qui entraînent leurs propres politiques (laboratoires, intégrateurs, startups humanoïdes), c'est un levier peu coûteux à tester. Les résultats restent toutefois obtenus sur benchmarks et tâches de manipulation en conditions contrôlées ; leur généralisation à des environnements industriels variés et à d'autres familles de VLA n'est pas démontrée. L'article s'inscrit dans la vague de recherche VLA ouverte par des systèmes comme RT-2, OpenVLA, Pi-0 ou GR00T, qui adaptent des modèles vision-langage préentraînés à la prédiction d'actions robotiques. L'essentiel des travaux récents porte sur l'échelle des données ou sur l'architecture (tokenisation des actions, diffusion, mélange d'experts) ; UVT prend le contre-pied en questionnant la cible de supervision elle-même, tout en restant compatible avec les architectures VLA existantes, ce qui facilite en théorie son adoption. La publication ne mentionne aucun partenariat industriel ni déploiement au-delà des tests de laboratoire. Il s'agit pour l'instant d'une contribution méthodologique dont l'impact dépendra de sa reproduction sur d'autres jeux de données et d'autres plateformes robotiques, humanoïdes comprises.

RecherchePaper
1 source
RA-VLA : adaptation d'un modèle vision-langage-action par récupération augmentée au moment de l'inférence
4arXiv cs.RO 

RA-VLA : adaptation d'un modèle vision-langage-action par récupération augmentée au moment de l'inférence

RA-VLA (arXiv 2608.25585v1) est un nouveau framework de type Vision-Language-Action (VLA) augmenté par récupération, conçu pour l'adaptation à l'exécution sans réentraînement. Les auteurs partent du constat que les modèles VLA, bien qu'utilisés comme socle généraliste pour la manipulation robotique, restent fragiles face à des distributions de tâches inédites. L'apprentissage par imitation en contexte (ICIL), approche existante ne nécessitant pas d'entraînement supplémentaire, souffre selon eux d'un goulot d'étranglement : des mécanismes de récupération superficiels et une forme d'inertie comportementale qui maintient la politique ancrée sur ses biais pré-entraînés. RA-VLA propose de corriger cela en combinant une récupération de contexte alignée sur le comportement recherché avec un pipeline d'exécution ancré dans des indices fonctionnels concrets. Le système a été évalué sur le benchmark LIBERO, référence standard pour la manipulation robotique en simulation, ainsi que sur un environnement réel utilisant un bras UR5e. Le résumé revendique des taux de réussite supérieurs et une meilleure efficacité de calcul par rapport aux méthodes existantes, sans toutefois fournir de chiffre précis (pourcentage de réussite, temps de cycle, latence) permettant de quantifier l'écart. Cette publication touche un point sensible du secteur : la capacité réelle des modèles VLA à généraliser au-delà de leurs données d'entraînement, alors que des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) présentent leurs modèles comme des socles universels prêts à s'adapter à de nouvelles tâches. En proposant une adaptation purement par récupération de contexte au moment de l'inférence, sans réentraînement, RA-VLA illustre une voie alternative au fine-tuning lourd, potentiellement utile pour des intégrateurs devant déployer des bras robotiques sur des tâches changeantes sans budget de réentraînement récurrent. Pour les décideurs B2B, ce travail rappelle surtout que le fossé entre démonstration et robustesse en conditions réelles reste un sujet de recherche actif, même pour les architectures VLA les plus médiatisées. Le papier s'inscrit dans la lignée des travaux sur l'apprentissage en contexte appliqué à la robotique, alternative au fine-tuning classique de modèles VLA de type RT-2 ou OpenVLA. Il ne mentionne aucun partenaire industriel ni aucun site de déploiement : il s'agit d'une contribution académique évaluée en simulation et sur un unique bras UR5e en laboratoire, sans code source public ni calendrier de suite indiqués. La compétition dans ce domaine reste dominée par les laboratoires et start-up développant des modèles fondation généralistes, tels que Physical Intelligence, NVIDIA, Google DeepMind ou Figure, pour lesquels la robustesse à l'adaptation en test reste un argument de différenciation central. RA-VLA se positionne comme une brique méthodologique susceptible d'être intégrée à ces architectures existantes plutôt que comme un produit ou un modèle concurrent autonome.

RechercheOpinion
1 source