Quand les instructions récupèrent des trajectoires : diagnostic et atténuation des échecs de généralisation des modèles VLA
Des chercheurs publient sur arXiv une analyse des échecs de généralisation des modèles vision-langage-action (VLA), accompagnée d'une méthode de correction baptisée Equivariant Counterfactual Training (ECT). Le constat de départ est que des VLA dépassent 90 % de réussite sur les tâches vues à l'entraînement et résistent aux changements parasites qui ne modifient pas l'action requise (éclairage, objets non pertinents). Ils échouent en revanche dès qu'une modification contrefactuelle impose une action différente, par exemple permuter la position de deux objets. Les auteurs nomment ce défaut « instruction-action binding » : la politique réagit au langage comme à la vision, mais ne les combine pas pour choisir l'action adaptée. Les analyses comportementales, menées sur des versions affinées de π0.5 et de GR00T-N1.7, montrent que les rollouts ratés répètent souvent le comportement de la tâche source ou basculent vers une autre tâche démontrée. Le langage n'est donc pas ignoré : il sert d'index vers une famille de trajectoires connues, et le retour visuel n'en ajuste que l'exécution. Sur le simulateur LIBERO-PRO, l'ECT complet fait passer le taux de réussite moyen de π0.5 en permutation de positions de 36 % à 59 %. Sur CALVIN, où les contreparties existent déjà dans les données, la seule fonction de perte ECT améliore l'enchaînement de cinq tâches sans nouvelle démonstration. Sur un bras UR5e réel, à budget de démonstrations constant, le succès sur positions inédites passe de 8 % à 88 %.
Ces résultats portent sur un point central pour le déploiement industriel : un score de robustesse agrégé peut masquer une faiblesse structurelle. Un VLA qui encaisse les perturbations visuelles banales peut rester un récupérateur de trajectoires, incapable de reconfigurer son geste quand la même consigne exige un mouvement différent dans une scène modifiée. Pour un intégrateur, c'est le cas typique d'une cellule dont l'agencement change entre deux lots. Le travail suggère aussi qu'une partie du problème tient à la composition des données et à l'objectif d'imitation, et non à la taille du modèle : lorsque l'action reste conditionnellement étroite, une solution ancrée dans la scène et une solution indexée sur l'instruction sont indiscernables sur les démonstrations. Corriger cela par des paires contrefactuelles, plutôt que par plus de volume, est une piste peu coûteuse. Une réserve s'impose : le gain de 8 % à 88 % vient d'un seul robot et d'un protocole à budget fixe, et le gain en simulation (+23 points) est plus modeste.
L'étude s'inscrit dans une série de travaux sur les limites de généralisation des VLA, alors que π0.5 de Physical Intelligence et la famille GR00T de NVIDIA servent de références ouvertes pour les politiques généralistes. Les benchmarks comme LIBERO-PRO et CALVIN ont été conçus pour mesurer cette généralisation, et les auteurs montrent que certains scores flatteurs reposent sur la mémorisation. Les suites probables sont des validations sur d'autres plateformes, des tâches plus longues et d'autres architectures de VLA. Il s'agit d'un préprint non évalué par les pairs, sans produit ni déploiement annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




