MixVLA : mélange adaptatif des informations non invariantes pour des modèles vision-langage-action (VLA) généralisables
Des chercheurs publient sur arXiv (2610.02898) MixVLA, un cadre d'entraînement pour modèles Vision-Language-Action (VLA) qui vise à améliorer la généralisation zéro-shot en conditions hors distribution (OOD). Le principe repose sur un module baptisé Adaptive Mixing of Non-Invariant Information (AMI). Celui-ci mélange de façon stochastique les représentations « non invariantes », c'est-à-dire les facteurs propres à un environnement comme l'apparence, l'éclairage ou la texture. Les représentations mélangées sont ensuite fusionnées avec les représentations invariantes, liées à la structure de la tâche, pour prédire l'action finale. La méthode est dite agnostique au modèle : elle ne demande ni donnée OOD supplémentaire ni modification d'architecture. Les auteurs l'évaluent sur LIBERO, LIBERO-Plus, la suite de perturbations de RoboTwin et des tâches réelles, et affirment une meilleure robustesse zéro-shot sans perte de performance en domaine. Le résumé ne donne aucun chiffre, ni gain, ni nom de modèle de base, ni nombre d'essais réels.
L'enjeu touche l'un des points faibles les mieux identifiés des VLA : leur fragilité dès que la scène s'écarte des données d'entraînement. Ces politiques tendent à s'appuyer sur des indices visuels parasites (fond, couleur, position de caméra) plutôt que sur la structure de la tâche, ce qui explique une part de l'écart entre démonstration et déploiement. Pour un intégrateur ou un responsable industriel, un gain obtenu par simple recette d'entraînement, sans nouvelle collecte de données ni changement d'architecture, serait précieux, car la collecte de téléopération reste l'un des postes de coût les plus lourds. Il faut toutefois rester prudent : sans résultats chiffrés, il est impossible de juger l'ampleur du gain, et les benchmarks de simulation, même perturbés, ne garantissent pas la robustesse en atelier. Le volet réel, dont l'ampleur n'est pas précisée, devra être examiné dans l'article complet.
Ce travail s'inscrit dans une série de recherches sur la robustesse des VLA. LIBERO-Plus et la suite de perturbations de RoboTwin ont été conçus pour exposer la sensibilité de ces modèles aux variations de caméra, d'éclairage, d'objets ou de langage, après que les scores quasi saturés sur LIBERO standard ont montré leurs limites. MixVLA se rapproche des techniques de régularisation et d'augmentation de représentations issues de la généralisation de domaine, ici transposées aux VLA. Il reste à voir s'il se montre complémentaire des grands modèles généralistes comme Pi-0 ou GR00T, et si le code et les poids sont publiés pour permettre une reproduction indépendante. Il s'agit d'une prépublication v1, non évaluée par des pairs, qui relève de la recherche et non d'un produit livré ou d'un déploiement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




