TOAST : tokenisation stochastique des actions de robot pour les modèles vision-langage-action (VLA) autorégressifs
Des chercheurs proposent TOAST (TOkenization of Action sequences with STochastic sampling), une méthode de tokenisation stochastique des actions pour les modèles Vision-Language-Action (VLA) autorégressifs, décrite dans un preprint arXiv (2610.00899v1). Ces modèles convertissent les actions continues du robot en séquences de tokens discrets, ce qui permet de les prédire avec l'objectif standard du token suivant. Le schéma FAST, référence actuelle, compresse des actions couvrant plusieurs fréquences temporelles en peu de tokens, mais attribue une seule tokenisation déterministe à chaque séquence d'actions quantifiée. TOAST, lui, tire au hasard pendant l'entraînement l'une des tokenisations alternatives de cette même séquence, sans changer le mouvement décodé et sans nouvelle démonstration. Sur le benchmark LIBERO, TOAST bat systématiquement sa version déterministe, avec un gain de 6,8 points de taux de succès quand seulement 1/16 des données d'entraînement est disponible. Sur quatre tâches de manipulation avec un robot réel, le taux de succès moyen progresse de 15,8 points.
Ces résultats visent un problème concret pour les équipes qui déploient des VLA : la rareté des démonstrations, qui coûtent cher en téléopération. Compresser les actions réduit le nombre de tokens à prédire, mais n'améliore pas l'efficacité d'apprentissage à partir de peu d'exemples. Les auteurs exploitent une redondance déjà présente dans la représentation, plusieurs suites de tokens pouvant décoder le même geste, comme une forme d'augmentation de données au niveau de la supervision. L'effet croît à mesure que les données diminuent, ce qui correspond au cas d'usage industriel, où l'on adapte une politique à une nouvelle tâche avec quelques dizaines de démonstrations. Il faut toutefois relativiser. Les gains sont mesurés par rapport à FAST seul, pas contre des politiques à diffusion ou à flow matching. L'évaluation réelle ne porte que sur quatre tâches, sans précision dans le résumé sur le robot, le nombre d'essais ou les intervalles de confiance. Un gain de 6,8 points sur LIBERO reste modeste, et les 15,8 points sur robot réel demandent à être confirmés sur davantage de tâches et de plateformes.
Ce travail s'inscrit dans le débat sur la meilleure façon de représenter les actions dans les VLA. D'un côté, la tokenisation discrète (FAST, dans la lignée de RT-2 et OpenVLA) conserve la simplicité d'un modèle de langage. De l'autre, des approches continues à diffusion ou flow matching, comme celles de la famille Pi-0, gèrent les actions de façon différente. TOAST défend la voie discrète en améliorant son efficacité en données plutôt qu'en changeant d'architecture. Il s'agit d'un preprint, non évalué par les pairs : aucun produit ni déploiement n'est annoncé. La suite logique serait des tests sur des benchmarks plus variés, une comparaison directe avec les politiques continues, et une vérification sur de grands modèles pré-entraînés.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




