Les modèles vision-langage-action (VLA) comprennent-ils les instructions ? Une étude d'interprétabilité mécaniste sur l'ancrage du langage
Une étude d'interprétabilité mécaniste, publiée sur arXiv (2610.10178), s'est demandé si les modèles Vision-Language-Action (VLA) utilisent réellement l'instruction textuelle pour générer leurs actions. Elle porte sur deux modèles de référence, π0.5 et GR00T N1.7. Les auteurs appliquent de l'activation patching et de l'attribution patching au flux résiduel des modules de génération d'actions. Ils corrompent les consignes de la base LIBERO selon cinq stratégies: remplacement par des synonymes, variation d'échelle sémantique, inversion directionnelle, substitution par un objet aléatoire et chaîne vide. Les deux modèles réagissent peu à une reformulation abstraite ou à la mention d'un objet inexistant. Ils réagissent fortement à une consigne vide et surtout au langage directionnel. Le siège de cette sensibilité diffère selon le modèle. Chez GR00T N1.7, elle se concentre dans les premières couches de cross-attention périodiques. Chez π0.5, elle est répartie entre les toutes premières couches et quelques couches plus tardives.
Ce résultat nuance l'idée que les VLA « comprennent » le langage. Une faible sensibilité aux synonymes pourrait être de la robustesse. Mais l'indifférence aux objets inexistants suggère que les modèles s'appuient largement sur des indices visuels et des corrélations de surface, plutôt que sur une vraie ancrage sémantique. Ces modèles n'ont pas de module de grounding explicite et dépendent des capacités de leur backbone vision-langage. Pour un intégrateur ou un responsable de déploiement, cela pose un risque concret: une consigne ambiguë, erronée ou sans rapport avec la scène peut ne pas être détectée, et le robot exécutera tout de même une tâche plausible. À l'inverse, la forte dépendance aux termes directionnels (gauche, droite, haut, bas) indique que ce sont les mots qui portent réellement l'information d'action. Les auteurs relèvent aussi que, pour GR00T N1.7, les perturbations directionnelles produisent certains des plus grands effets causaux alors que la géométrie interne des représentations change peu. Ce découplage n'apparaît pas nettement chez π0.5. Enfin, l'attribution patching, méthode d'approximation peu coûteuse, suit fidèlement l'activation patching pour GR00T N1.7 mais pas pour π0.5. Sa fiabilité dépend donc du modèle et ne peut pas être supposée.
Le contexte est celui d'une course aux modèles généralistes, où π0.5 (Physical Intelligence) et la série GR00T (NVIDIA) servent de références. Leur évaluation repose souvent sur des benchmarks comme LIBERO, dont les scènes, qui répètent des configurations proches, peuvent masquer une dépendance limitée au langage. Cette étude s'inscrit dans un courant de travaux d'audit qui testent la robustesse linguistique et visuelle avant tout déploiement réel. Il s'agit d'un travail de recherche en simulation, sans produit ni pilote associé. Les suites probables sont des protocoles d'évaluation plus exigeants, avec des consignes contradictoires, et des méthodes d'entraînement ou des architectures qui renforcent l'ancrage du langage.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




