Réfléchir uniquement quand c'est nécessaire : contrôle par autorité de prompt pour une intervention sélective en mode lent dans la manipulation VLA
Un article publié sur arXiv (référence 2608.23224v1) documente un phénomène baptisé effondrement de forme du prompt dans le pilotage de robots par des modèles vision-langage-action (VLA). Ajouter du texte récupéré au prompt d'une politique VLA gelée, sans réentraînement, fait chuter le taux de réussite moyen de 92,47 % à 3,00 % sur 500 états testés, un ajout dénué de sens mais de longueur équivalente échouant tout aussi complètement. Les auteurs introduisent TOWN-VLA, une interface qui sépare la génération de texte candidat de l'autorisation de modifier l'entrée de la politique : une règle fixe n'autorise qu'une instruction compacte canonique, sinon le prompt original est restauré à l'identique, un contrat respecté sur les 900 routes auditées (525 restaurations vérifiées par empreinte, 375 prompts autorisés préservant la tâche). Sur l'évaluation LIBERO-Plus (grille 4x7, 10 030 épisodes par méthode), le taux de réussite passe de 69,5 % à 73,1 %, avec des gains sur les six axes de perturbation et les quatre suites testées. Sur un bras physique PiPER piloté par un checkpoint gelé du modèle π0.5, il grimpe de 52,7 % à 78,7 % sur 150 essais par méthode (p=3,16x10^-6).
Ce résultat vise une pratique répandue : l'augmentation par récupération de contexte sur un modèle gelé, sans réentraînement coûteux, est perçue comme un moyen sûr d'enrichir une politique VLA en production. Or un texte sémantiquement vide provoque le même échec total qu'un texte informatif, preuve que c'est la forme de l'instruction, et non son contenu, qui domine l'exécution, un angle mort pour les intégrateurs qui supposent qu'ajouter du contexte ne peut que rester neutre ou aider. Pour les décideurs évaluant des piles VLA prêtes à l'emploi, ce travail plaide pour une couche de contrôle d'autorité sur les prompts, séparée du modèle de génération, avant tout déploiement réel.
Le travail s'appuie sur un modèle gelé de la famille pi-zero (π0.5), développée par Physical Intelligence, ce qui positionne TOWN-VLA comme une couche de contrôle générique plutôt qu'un modèle concurrent d'architectures comme GR00T N2 de NVIDIA ou Helix de Figure AI. Les auteurs indiquent que la prochaine étape est une calibration d'admission sans oracle, signe que le système reste, à ce stade, un résultat de recherche audité en simulation et sur un bras robotique isolé, sans déploiement industriel ni pilote commercial annoncé.
Dans nos dossiers




