Reformule avant d'agir : caractérisation et atténuation de la sensibilité au langage des modèles vision-langage-action (VLA)
Les modèles vision-langage-action (VLA) ne tiennent pas la promesse de robustesse linguistique de leurs modèles vision-langage d'origine, selon une étude (arXiv 2610.10526) qui chiffre cette fragilité sur LIBERO, un banc d'essai de manipulation en simulation. Sur ce benchmark, π0.5 allume la cuisinière dans 100 % des essais avec « switch on the stove », mais seulement 2 % avec « switch on the hot plate ». Un checkpoint π0 finetuné avec de l'augmentation par reformulation affiche encore des écarts allant jusqu'à 61 points pour une simple variation de phrasé. Les auteurs mesurent ces variations par des tests statistiques d'écarts à une seule édition, puis par une recherche « oracle » de la meilleure formulation. Celle-ci montre que le phrasé seul comble presque entièrement l'écart de 21 points entre tâches in-distribution et hors distribution.
Leur correctif ne touche pas à la politique. Ils évaluent de nombreuses formulations sur quelques tâches d'entraînement, puis un grand modèle de langage distille ces résultats en dix à vingt règles de reformulation. Au déploiement, chaque consigne entrante est réécrite une seule fois selon ces règles, sans réentraînement ni vérification à chaque pas de temps. Sur un π0 gelé, le gain relatif est de 16 à 27 % sur douze tâches tenues à l'écart, avec des phrasés adversariaux, générés par VLM et rédigés par des humains. Les progrès se concentrent sur les tâches hors distribution. Sur π0.5 et LIBERO, le taux de succès « in-finetune » passe de 93,6 % à 97,8 %. Il s'agit de résultats de simulation et de benchmark. Rien n'est annoncé en déploiement physique ni sur un produit livré.
Pour les intégrateurs et les équipes qui évaluent des VLA, le résultat remet en cause l'idée que la compréhension du langage hérite telle quelle du préentraînement du VLM. Un opérateur qui dit « plaque chauffante » plutôt que « cuisinière » peut faire échouer la tâche presque à coup sûr. Les scores moyens des benchmarks, mesurés avec les formulations canoniques, risquent donc de surestimer la fiabilité en atelier ou en entrepôt, où les consignes varient selon les personnes. Le travail propose aussi une réponse peu coûteuse, puisqu'une couche de réécriture en amont s'ajoute à une politique figée sans nouvelle collecte de données. Reste à voir si cela tient sur robot réel, avec des consignes plus longues et du bruit de reconnaissance vocale. Le coût d'un appel LLM supplémentaire par consigne est faible, mais il ajoute une dépendance et de la latence au démarrage de la tâche.
Ce travail s'inscrit dans la série des politiques généralistes de Physical Intelligence (π0, puis π0.5), devenues des références open source. Celles-ci côtoient des approches concurrentes comme GR00T chez NVIDIA ou Helix chez Figure, dont la robustesse linguistique n'est pas documentée publiquement dans des termes comparables. LIBERO est un benchmark commode mais limité, et la plupart des publications sur les VLA le saturent déjà avec des consignes fixes. Les prochaines étapes naturelles sont des tests sur matériel physique et sur d'autres familles de VLA. Les auteurs publient une page de projet, sttawm.github.io/rephrase-before-you-act.
Dans nos dossiers




