
Au-delà de l'erreur de reconstruction : tokenisation d'action analytique et pilotée par les données pour les modèles VLA autorégressifs
Une étude diffusée sur arXiv (référence 2609.25820) compare trois façons de représenter les actions robotiques dans les modèles vision-langage-action (VLA) autorégressifs avant de les découper en tokens discrets : une transformation analytique fixe (Temporal-DCT), une méthode linéaire pilotée par les données (analyse en composantes principales, PCA), et un autoencodeur neuronal non linéaire. Testées sous une interface de tokenisation commune, via une analyse débit-distorsion, des diagnostics de modélisation de séquence et 3 500 essais sur le benchmark de manipulation en simulation LIBERO, ces représentations changent de classement selon le critère mesuré. La PCA affiche une erreur de reconstruction plus faible que Temporal-DCT, mais produit des séquences de tokens moins prévisibles et un taux de réussite moyen inférieur de 3,0 points de pourcentage sur les tâches déjà vues, sur trois seeds d'entraînement, avec un classement qui s'inverse pour l'une d'elles. Dans une ablation à seed fixe (42), l'autoencodeur réduit encore l'erreur de reconstruction sans produire la politique la plus performante, et se montre plus sensible aux perturbations de tokens.
Le résultat contredit une hypothèse répandue dans la conception des VLA : qu'une représentation qui reconstruit mieux le signal d'action original est nécessairement une meilleure base pour le contrôle en boucle fermée. L'étude montre l'inverse, la prévisibilité de la séquence de tokens et la robustesse du décodeur face aux erreurs de discrétisation pèsent autant que la fidélité géométrique sur le taux de réussite final. Pour les équipes qui construisent des VLA autorégressifs sur le modèle des grands modèles de langage, cela signifie qu'un tokenizer d'action ne peut plus être choisi sur la seule base d'un score de reconstruction, mais doit être validé par une évaluation conjointe incluant la performance en conditions de contrôle réel, un rappel utile dans un secteur où l'écart entre métriques de laboratoire et robustesse déployée reste une inquiétude constante pour les intégrateurs.
Ce travail s'inscrit dans le courant qui traite le contrôle robotique comme un problème de prédiction de séquence de tokens, à l'image du texte dans les modèles de langage, en alternative aux architectures VLA à sortie continue. Plutôt que de proposer un nouveau tokenizer, les auteurs construisent un protocole comparatif rigoureux entre approches analytique, linéaire et neuronale, un cadre d'évaluation encore peu standardisé dans ce sous-domaine. La suite logique consisterait à étendre ces diagnostics de prévisibilité et de stabilité au-delà de LIBERO, vers d'autres jeux de tâches et architectures de politique, ainsi qu'à comparer plus directement tokenisation discrète et régression continue pour trancher ce débat de conception au sein des VLA.
Dans nos dossiers




