MaskVLA : le masquage visuel contre le surapprentissage des trajectoires des modèles vision-langage-action
Publiée sur arXiv en cross-listing sous la référence 2609.23565v1 (septembre 2026), MaskVLA est une méthode de finetuning pour les modèles vision-langage-action (VLA) qui pilotent des bras robotiques à partir d'instructions et de flux caméra. Le constat de départ : finetunés sur des jeux de démonstrations limités, ces modèles mémorisent des trajectoires spécifiques au lieu d'apprendre une politique généralisable, un phénomène que les auteurs nomment le "trajectory overfitting". La méthode masque aléatoirement une petite portion du flux vidéo de la caméra principale durant l'entraînement, forçant le modèle à mieux exploiter la caméra de poignet et à apprendre des traits visuels plus fins. Sur le benchmark de simulation RoboTwin 2.0, MaskVLA améliore le taux de réussite moyen de 23,2 % face à Pi-0 et de 16,8 % face à OpenVLA-OFT, un gain confirmé sur un bras robotique réel de la plateforme ALOHA.
La rareté des démonstrations réelles oblige la plupart des laboratoires à finetuner leurs VLA sur des jeux de données restreints, produisant des politiques fragiles dès qu'un objet change de position ou d'apparence : le problème visé n'est donc pas anecdotique. Qu'une simple restriction du signal de la caméra principale, technique de régularisation légère et peu coûteuse, suffise à dégager des gains à deux chiffres face à des références établies comme Pi-0 et OpenVLA-OFT suggère que la marge de progrès des VLA ne tient pas qu'à l'échelle du pré-entraînement mais aussi à l'exploitation de l'information multicaméra, en particulier la caméra de poignet, souvent sous-utilisée dans les politiques bout-en-bout des plateformes bi-bras comme ALOHA. Contrairement à une nouvelle architecture, MaskVLA reste une recette d'entraînement facile à intégrer dans des pipelines existants.
Le travail reste au stade de preprint, sans revue par les pairs confirmée ni produit commercial associé. Il s'inscrit dans la lignée des travaux sur la généralisation des politiques VLA initiés par Pi-0 de Physical Intelligence et OpenVLA-OFT, utilisés ici comme étalons de comparaison, aux côtés d'autres modèles généralistes du secteur comme GR00T N2 de Nvidia ou Helix de Figure AI, qui visent la même robustesse avec peu de démonstrations. RoboTwin 2.0 et la plateforme ALOHA, issue des travaux de téléopération bas coût de Stanford et Berkeley, servent de terrain de validation standard pour ce type de méthode. Aucun acteur français ou européen n'est cité dans cette étude, et les auteurs ne donnent aucun calendrier de suite.
Dans nos dossiers




