Aller au contenu principal
RecherchearXiv cs.RO 

TOAST : tokenisation stochastique des actions de robot pour les modèles vision-langage-action (VLA) autorégressifs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent TOAST (TOkenization of Action sequences with STochastic sampling), une méthode de tokenisation stochastique des actions pour les modèles Vision-Language-Action (VLA) autorégressifs, décrite dans un preprint arXiv (2610.00899v1). Ces modèles convertissent les actions continues du robot en séquences de tokens discrets, ce qui permet de les prédire avec l'objectif standard du token suivant. Le schéma FAST, référence actuelle, compresse des actions couvrant plusieurs fréquences temporelles en peu de tokens, mais attribue une seule tokenisation déterministe à chaque séquence d'actions quantifiée. TOAST, lui, tire au hasard pendant l'entraînement l'une des tokenisations alternatives de cette même séquence, sans changer le mouvement décodé et sans nouvelle démonstration. Sur le benchmark LIBERO, TOAST bat systématiquement sa version déterministe, avec un gain de 6,8 points de taux de succès quand seulement 1/16 des données d'entraînement est disponible. Sur quatre tâches de manipulation avec un robot réel, le taux de succès moyen progresse de 15,8 points.

Ces résultats visent un problème concret pour les équipes qui déploient des VLA : la rareté des démonstrations, qui coûtent cher en téléopération. Compresser les actions réduit le nombre de tokens à prédire, mais n'améliore pas l'efficacité d'apprentissage à partir de peu d'exemples. Les auteurs exploitent une redondance déjà présente dans la représentation, plusieurs suites de tokens pouvant décoder le même geste, comme une forme d'augmentation de données au niveau de la supervision. L'effet croît à mesure que les données diminuent, ce qui correspond au cas d'usage industriel, où l'on adapte une politique à une nouvelle tâche avec quelques dizaines de démonstrations. Il faut toutefois relativiser. Les gains sont mesurés par rapport à FAST seul, pas contre des politiques à diffusion ou à flow matching. L'évaluation réelle ne porte que sur quatre tâches, sans précision dans le résumé sur le robot, le nombre d'essais ou les intervalles de confiance. Un gain de 6,8 points sur LIBERO reste modeste, et les 15,8 points sur robot réel demandent à être confirmés sur davantage de tâches et de plateformes.

Ce travail s'inscrit dans le débat sur la meilleure façon de représenter les actions dans les VLA. D'un côté, la tokenisation discrète (FAST, dans la lignée de RT-2 et OpenVLA) conserve la simplicité d'un modèle de langage. De l'autre, des approches continues à diffusion ou flow matching, comme celles de la famille Pi-0, gèrent les actions de façon différente. TOAST défend la voie discrète en améliorant son efficacité en données plutôt qu'en changeant d'architecture. Il s'agit d'un preprint, non évalué par les pairs : aucun produit ni déploiement n'est annoncé. La suite logique serait des tests sur des benchmarks plus variés, une comparaison directe avec les politiques continues, et une vérification sur de grands modèles pré-entraînés.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

ActionPiece : repenser la tokenisation des actions pour les modèles vision-langage-action autorégressifs
1arXiv cs.RO 

ActionPiece : repenser la tokenisation des actions pour les modèles vision-langage-action autorégressifs

Un article de recherche publié le 17 septembre 2026 sur arXiv (référence 2609.18487v1) propose ActionPiece, une nouvelle méthode de tokenisation d'actions pour les modèles vision-langage-action (VLA) autorégressifs. Ces modèles convertissent les commandes robotiques continues en tokens discrets, puis les régénèrent en commandes exécutables. Les auteurs introduisent une métrique baptisée "physical rank consistency" (PRC), qui évalue si la tokenisation conserve l'ordre relatif des distances physiques entre actions proches, un aspect ignoré par l'erreur quadratique moyenne (MSE) habituellement utilisée pour juger la fidélité de reconstruction. ActionPiece combine deux objectifs d'apprentissage joints : une supervision du rang physique sur les distances de l'encodeur et des features quantifiées, et une régularisation appliquant le même ordre aux assignations de codewords. Testé avec un pipeline d'entraînement de politique basé sur Qwen3-VL-4B, le système atteint 94,8% de réussite sur le benchmark de simulation LIBERO, 68,8% sur LIBERO-Plus (tâches non vues à l'entraînement), 71,9% sur SimplerEnv et 51,5% sur VLA-Arena (niveaux L0 à L2). Ce travail cible un maillon technique précis mais central dans l'architecture des VLA autorégressifs : la façon dont les actions continues sont discrétisées avant d'être traitées comme des tokens de langage. Un tokenizer imprécis peut faire converger des actions distinctes vers une même représentation, ce qui aplatit les nuances nécessaires à des contextes différents, un problème invisible aux métriques ponctuelles classiques. Pour les équipes qui construisent des politiques VLA (bras robotiques, humanoïdes), cela suggère que les gains de performance ne viennent pas uniquement de modèles plus gros, mais aussi de la qualité de la représentation intermédiaire des actions, un point souvent négligé face à l'attention portée aux architectures de perception ou de langage. Le papier s'inscrit dans un débat plus large sur la tokenisation discrète des actions (utilisée par des lignées de modèles type RT-2 ou OpenVLA) face aux approches à génération continue ou par diffusion, telles que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Toutes les évaluations présentées restent toutefois limitées à des benchmarks de simulation (LIBERO, SimplerEnv, VLA-Arena), sans validation sur robot physique ni déploiement industriel annoncé à ce stade.

RechercheActu
1 source
Au-delà de l'erreur de reconstruction : tokenisation d'action analytique et pilotée par les données pour les modèles VLA autorégressifs
2arXiv cs.RO 

Au-delà de l'erreur de reconstruction : tokenisation d'action analytique et pilotée par les données pour les modèles VLA autorégressifs

Une étude diffusée sur arXiv (référence 2609.25820) compare trois façons de représenter les actions robotiques dans les modèles vision-langage-action (VLA) autorégressifs avant de les découper en tokens discrets : une transformation analytique fixe (Temporal-DCT), une méthode linéaire pilotée par les données (analyse en composantes principales, PCA), et un autoencodeur neuronal non linéaire. Testées sous une interface de tokenisation commune, via une analyse débit-distorsion, des diagnostics de modélisation de séquence et 3 500 essais sur le benchmark de manipulation en simulation LIBERO, ces représentations changent de classement selon le critère mesuré. La PCA affiche une erreur de reconstruction plus faible que Temporal-DCT, mais produit des séquences de tokens moins prévisibles et un taux de réussite moyen inférieur de 3,0 points de pourcentage sur les tâches déjà vues, sur trois seeds d'entraînement, avec un classement qui s'inverse pour l'une d'elles. Dans une ablation à seed fixe (42), l'autoencodeur réduit encore l'erreur de reconstruction sans produire la politique la plus performante, et se montre plus sensible aux perturbations de tokens. Le résultat contredit une hypothèse répandue dans la conception des VLA : qu'une représentation qui reconstruit mieux le signal d'action original est nécessairement une meilleure base pour le contrôle en boucle fermée. L'étude montre l'inverse, la prévisibilité de la séquence de tokens et la robustesse du décodeur face aux erreurs de discrétisation pèsent autant que la fidélité géométrique sur le taux de réussite final. Pour les équipes qui construisent des VLA autorégressifs sur le modèle des grands modèles de langage, cela signifie qu'un tokenizer d'action ne peut plus être choisi sur la seule base d'un score de reconstruction, mais doit être validé par une évaluation conjointe incluant la performance en conditions de contrôle réel, un rappel utile dans un secteur où l'écart entre métriques de laboratoire et robustesse déployée reste une inquiétude constante pour les intégrateurs. Ce travail s'inscrit dans le courant qui traite le contrôle robotique comme un problème de prédiction de séquence de tokens, à l'image du texte dans les modèles de langage, en alternative aux architectures VLA à sortie continue. Plutôt que de proposer un nouveau tokenizer, les auteurs construisent un protocole comparatif rigoureux entre approches analytique, linéaire et neuronale, un cadre d'évaluation encore peu standardisé dans ce sous-domaine. La suite logique consisterait à étendre ces diagnostics de prévisibilité et de stabilité au-delà de LIBERO, vers d'autres jeux de tâches et architectures de politique, ainsi qu'à comparer plus directement tokenisation discrète et régression continue pour trancher ce débat de conception au sein des VLA.

RecherchePaper
1 source
Des pixels aux tokens : étude systématique de la supervision par actions latentes pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

Des pixels aux tokens : étude systématique de la supervision par actions latentes pour les modèles vision-langage-action (VLA)

Des chercheurs de l'Université Renmin de Chine (RUC) ont publié le 7 mai 2026 une étude systématique sur la supervision par actions latentes dans les modèles VLA (Vision-Language-Action), une architecture clé pour les robots capables de comprendre des instructions en langage naturel et d'agir dans le monde physique. L'article, référencé arXiv:2605.04678, pose une question concrète : comment entraîner efficacement un VLA sur des datasets hétérogènes, issus de robots différents avec des espaces d'action incompatibles ? La réponse explorée est l'action latente, une représentation intermédiaire abstraite qui sert de pivot commun entre perception visuelle, langage et commande motrice. Les auteurs comparent quatre stratégies d'intégration sous une baseline VLA unifiée, en distinguant deux familles : les actions latentes basées sur l'image (qui encodent les transitions visuelles entre frames) et celles basées sur l'action (qui compressent directement les commandes moteurs dans un espace latent). Les résultats révèlent une correspondance formulation-tâche claire, ce qui est utile pour tout intégrateur qui choisit une architecture : les actions latentes image-based sont plus efficaces sur les tâches longues nécessitant un raisonnement multi-étapes et une généralisation au niveau de la scène, tandis que les actions latentes action-based surperforment sur la coordination motrice fine et complexe. La découverte la plus opérationnelle est que superviser directement le modèle de langage vision (VLM) avec des tokens discrets d'actions latentes donne les meilleures performances globales, devançant les approches de supervision continue ou indirecte. L'étude apporte également des premières preuves que la supervision par actions latentes améliore l'entraînement en données mixtes (multi-robot, multi-tâche), un verrou majeur pour passer du lab au déploiement à grande échelle. Ce travail s'inscrit dans une course effrénée à la généralisation des VLA, après les succès récents de Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA), qui ont tous démontré des capacités cross-embodiment limitées mais prometteuses. La contribution de RUC est moins un nouveau modèle qu'un benchmark de design choices, un type de contribution rare et précieux dans un domaine encore dominé par les démonstrations spectaculaires. La prochaine étape naturelle serait de valider ces résultats sur du matériel réel au-delà des benchmarks simulés, notamment sur des plateformes comme ALOHA 2 ou des manipulateurs industriels, pour confirmer que le gap sim-to-real ne neutralise pas les gains observés en simulation. Le code est disponible sur GitHub (RUCKBReasoning/FromPixelsto_Tokens).

RechercheOpinion
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
4arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source