Décomposition direction-échelle dans la représentation d'action : repenser ce qu'il faut tokeniser pour les modèles vision-langage-action
Un nouveau papier publié sur arXiv (2609.28865) propose Direction-Scale Decomposition (DSD), une méthode pour améliorer la représentation des actions dans les modèles vision-langage-action (VLA) à tokens discrets, en partant du constat que les représentations classiques par incréments de pose produisent des tokens sensibles à la vitesse d'exécution et aux normalisations propres à chaque dataset, ce qui brouille la structure géométrique commune aux démonstrations. DSD décompose les incréments de translation et de rotation en une composante direction et une composante échelle avant la tokenisation, isolant le sens du mouvement tout en conservant les amplitudes dans des canaux séparés. Testée avec deux tokenizers, un binning uniforme (BIN) et BEAST, un tokenizer basé sur des B-splines, en simulation comme sur robot réel et en entraînement mono comme multi-datasets, la méthode améliore le taux de succès moyen sur le benchmark LIBERO avec les deux tokenizers, et fait gagner 10,3 points de pourcentage à DSD-BIN par rapport à BIN sur SimplerEnv en entraînement multi-datasets. Les expériences sur robot réel confirment des gains, avec et sans pré-entraînement robotique.
Pour les équipes qui entraînent des VLA sur des mélanges hétérogènes de datasets, ce résultat cible un point de friction concret : la dégradation de performance observée quand on combine des démonstrations collectées à des vitesses, fréquences ou conventions de normalisation différentes. En isolant la direction du mouvement des variations d'amplitude liées au dataset, DSD s'attaque à ce qui limite le passage à l'échelle des politiques de manipulation entraînées sur de grands corpus agrégés, un enjeu central alors que le secteur cherche à reproduire pour la robotique le scaling qui a fonctionné pour les modèles de langage. Le gain observé sur SimplerEnv en régime multi-datasets suggère, s'il se confirme sur d'autres benchmarks, que le choix de représentation d'action, souvent traité comme un détail d'implémentation, pèse autant que l'architecture du modèle ou la taille du dataset dans la qualité finale d'une politique VLA.
Ce travail s'inscrit dans un champ encore jeune consacré à la tokenisation des actions pour les VLA à sortie discrète, un terrain qui coexiste avec des architectures propriétaires à sortie continue comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. DSD se positionne comme une amélioration compatible avec des tokenizers existants tels que le binning uniforme ou BEAST, plutôt que comme un tokenizer concurrent supplémentaire, et l'abstract ne précise ni la plateforme robotique utilisée pour les essais réels ni le laboratoire à l'origine des travaux. Une page de projet (vla-dsd.github.io) met à disposition du code et des ressources additionnelles, en vue d'une validation attendue sur des architectures VLA plus larges et des jeux de données de manipulation plus diversifiés.
Dans nos dossiers




