ActionPiece : repenser la tokenisation des actions pour les modèles vision-langage-action autorégressifs
Un article de recherche publié le 17 septembre 2026 sur arXiv (référence 2609.18487v1) propose ActionPiece, une nouvelle méthode de tokenisation d'actions pour les modèles vision-langage-action (VLA) autorégressifs. Ces modèles convertissent les commandes robotiques continues en tokens discrets, puis les régénèrent en commandes exécutables. Les auteurs introduisent une métrique baptisée "physical rank consistency" (PRC), qui évalue si la tokenisation conserve l'ordre relatif des distances physiques entre actions proches, un aspect ignoré par l'erreur quadratique moyenne (MSE) habituellement utilisée pour juger la fidélité de reconstruction. ActionPiece combine deux objectifs d'apprentissage joints : une supervision du rang physique sur les distances de l'encodeur et des features quantifiées, et une régularisation appliquant le même ordre aux assignations de codewords. Testé avec un pipeline d'entraînement de politique basé sur Qwen3-VL-4B, le système atteint 94,8% de réussite sur le benchmark de simulation LIBERO, 68,8% sur LIBERO-Plus (tâches non vues à l'entraînement), 71,9% sur SimplerEnv et 51,5% sur VLA-Arena (niveaux L0 à L2).
Ce travail cible un maillon technique précis mais central dans l'architecture des VLA autorégressifs : la façon dont les actions continues sont discrétisées avant d'être traitées comme des tokens de langage. Un tokenizer imprécis peut faire converger des actions distinctes vers une même représentation, ce qui aplatit les nuances nécessaires à des contextes différents, un problème invisible aux métriques ponctuelles classiques. Pour les équipes qui construisent des politiques VLA (bras robotiques, humanoïdes), cela suggère que les gains de performance ne viennent pas uniquement de modèles plus gros, mais aussi de la qualité de la représentation intermédiaire des actions, un point souvent négligé face à l'attention portée aux architectures de perception ou de langage.
Le papier s'inscrit dans un débat plus large sur la tokenisation discrète des actions (utilisée par des lignées de modèles type RT-2 ou OpenVLA) face aux approches à génération continue ou par diffusion, telles que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Toutes les évaluations présentées restent toutefois limitées à des benchmarks de simulation (LIBERO, SimplerEnv, VLA-Arena), sans validation sur robot physique ni déploiement industriel annoncé à ce stade.




