Aller au contenu principal
RecherchearXiv cs.RO 

ActionCodec : ce qui fait un bon tokeniseur d'actions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient ActionCodec, un tokenizer d'actions pour les modèles Vision-Langage-Action (VLA) qui reposent sur le paradigme autorégressif natif des modèles vision-langage (VLM). Le travail, déposé sur arXiv (2602.15397, version 2), part d'un constat : la conception de la tokenisation d'actions, étape qui convertit des trajectoires continues en tokens discrets prédits par le modèle, a surtout été guidée par la fidélité de reconstruction. Son effet direct sur l'optimisation du VLA a peu été étudié. Les auteurs dégagent donc des principes de conception issus de la théorie de l'information : maximiser le chevauchement temporel entre tokens, réduire la redondance du vocabulaire, augmenter l'information mutuelle avec les modalités vision et langage, et garantir l'indépendance des tokens. Sur le benchmark de simulation LIBERO, un SmolVLM2-2.2B (2,2 milliards de paramètres) affiné avec ActionCodec atteint 95,5 % de réussite sans aucun pré-entraînement robotique. Avec des améliorations architecturales supplémentaires, le score monte à 97,4 %, présenté comme un nouvel état de l'art pour les VLA sans pré-entraînement robotique. Les auteurs annoncent aussi des gains d'efficacité d'entraînement et de performance sur plusieurs benchmarks, en simulation comme en conditions réelles, et publient le modèle.

L'enjeu dépasse le simple score. Si la qualité du tokenizer pèse autant sur l'optimisation que l'architecture ou les données, une partie des écarts attribués à la taille du modèle ou au pré-entraînement pourrait venir de ce composant souvent traité comme un détail. Un petit VLM de 2,2 milliards de paramètres qui frôle les 97 % sans corpus de démonstrations robotiques massif intéresse directement les équipes aux budgets de calcul et de données limités, notamment les intégrateurs qui adaptent des modèles ouverts à leurs cellules. Il faut toutefois relativiser : LIBERO est un benchmark de simulation désormais proche de la saturation, et un score élevé ne dit rien de la robustesse en environnement industriel, de la latence d'inférence ni du coût de déploiement. Le résumé ne précise ni le nombre d'essais réels, ni les plateformes utilisées, ni la comparaison à compute égal avec les tokenizers concurrents. Ces points devront être vérifiés dans l'article complet.

Le travail s'inscrit dans la lignée des VLA autorégressifs, qui ont popularisé la discrétisation des actions. Des tokenizers fondés sur la compression fréquentielle, comme FAST associé à Pi-0, ou des approches par quantification vectorielle, ont montré que le choix de représentation conditionne l'apprentissage. À l'opposé, des architectures à têtes de diffusion ou de flow matching, utilisées par plusieurs modèles de fondation robotiques, évitent la tokenisation discrète au prix d'une chaîne d'entraînement plus complexe. ActionCodec se positionne comme un argument en faveur du paradigme purement autorégressif, qui conserve la compatibilité avec l'outillage des VLM. La suite dépendra de la reproductibilité par la communauté, grâce au modèle publié, et d'une validation sur des tâches longues, bimanuelles ou mobiles, où le gain sur LIBERO ne se transposera pas forcément.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Au-delà de la reconstruction : qu'est-ce qui compte dans la tokenisation d'actions pour les politiques robotiques ?
1arXiv cs.RO 

Au-delà de la reconstruction : qu'est-ce qui compte dans la tokenisation d'actions pour les politiques robotiques ?

Les politiques robotiques autorégressives, dont les modèles vision-langage-action (VLA), convertissent des séquences de tokens discrets en commandes continues grâce à un « tokenizer » d'actions. Une équipe de chercheurs publie sur arXiv (2610.09170) ProAct, pour Predictable and Robust Action Tokenization, une méthode d'entraînement de ces tokenizers. Elle ne dépend d'aucune politique particulière et n'utilise que des jeux de données d'actions. Testée sur les benchmarks Robomimic, LIBERO et RoboTwin, avec plusieurs architectures de tokenizers, elle améliore le taux de réussite en rollout de 11,3 points de pourcentage en moyenne. Le gain atteint 21,8 points sur des VLA et 36,7 points en manipulation robotique réelle. Les résumés de ce type ne précisent pas toujours les tâches, les robots ou le nombre d'essais physiques. Il faudra donc lire l'article complet pour juger de la robustesse de ces chiffres. La plupart des tokenizers apprennent la correspondance entre tokens et actions par un objectif de reconstruction. Les auteurs montrent qu'une reconstruction suffisamment fidèle ne garantit pas une bonne politique. Deux autres propriétés comptent. La politique doit prédire les bons tokens face à des observations nouvelles. Et les tokens qu'elle prédit sans les avoir vus à l'entraînement doivent quand même se décoder en actions plausibles. Ni l'une ni l'autre n'est favorisée par la seule reconstruction. ProAct complète donc celle-ci pour améliorer la prévisibilité et la robustesse. Pour les équipes qui construisent des VLA, le message est concret : le tokenizer n'est pas un simple module de compression. C'est une interface de conception à part entière, qui doit équilibrer fidélité, prévisibilité et robustesse. Le gain le plus marqué en conditions réelles suggère aussi qu'une partie de l'écart entre démonstration et déploiement pourrait venir de ce maillon, et pas seulement de la taille des modèles ou du volume de données. Ce travail s'inscrit dans le courant des politiques qui discrétisent les actions pour réutiliser les architectures de modèles de langage, comme l'approche de tokenisation par compression popularisée avec les modèles de type Pi-0-FAST. Il rejoint les critiques sur les méthodes qui jugent un tokenizer à sa seule erreur de reconstruction. Le fait que ProAct soit indépendant de la politique et n'utilise que des données d'actions facilite son intégration dans des pipelines existants, sans réentraîner l'ensemble de la pile. Les concurrents sont les approches continues, notamment par diffusion ou flow matching, qui évitent la tokenisation. Aucun pilote industriel ni calendrier de publication de code n'est mentionné dans le résumé. Il s'agit pour l'instant d'une preuve de concept académique, dont l'adoption dépendra de la reproductibilité des résultats par d'autres laboratoires.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
NAC : un codec neuronal d'actions pour les modèles vision-langage-action
2arXiv cs.RO 

NAC : un codec neuronal d'actions pour les modèles vision-langage-action

Des chercheurs publient une version mise à jour (v2) du préprint arXiv 2606.21372, intitulé « NAC: Neural Action Codec for Vision-Language-Action Models », qui introduit un nouveau tokenizer d'actions pour les modèles vision-langage-action (VLA). Le NAC reprend l'architecture des codecs audio neuronaux, encodeur-décodeur convolutif à quantification vectorielle résiduelle (RVQGAN) utilisée dans les modèles de fondation audio, en traitant les courtes trajectoires d'actions robotiques comme des signaux 1D multicanaux compressés à plusieurs échelles. Le système produit un espace de tokens compact et ordonné via des codebooks décalés, ce qui permet à des politiques autorégressives standard de fonctionner sur des séquences courtes et structurées ; la reconstruction des trajectoires s'appuie sur un décodeur de style Vocos, avec tête ISTFT et discriminateurs adversariaux. Évalué sur les bancs d'essai LIBERO-10 et RoboMimic, ainsi que sur une série de tâches de manipulation réelles, NAC atteint une fidélité de reconstruction élevée et des taux de réussite moyens supérieurs au binning, à FAST et aux tokenizers VQ antérieurs, à taux de compression comparable ou meilleur. Le tokenizer d'actions est le goulot d'étranglement discret entre commande continue du robot et modélisation de séquence autorégressive au cœur de tout VLA ; jusqu'ici, binning, FAST et quantification vectorielle classique forçaient un compromis entre compression, latence et performance. En montrant qu'une architecture éprouvée pour l'audio se transpose presque sans changement structurel au contrôle robotique, ce travail suggère que la tokenisation d'actions n'est plus le facteur limitant majeur pour faire passer à l'échelle les politiques VLA, un enjeu concret pour tout intégrateur entraînant des politiques génériques de manipulation sur plusieurs tâches et morphologies de robot. Le gain de taux de réussite à compression égale ou supérieure compte surtout pour le temps réel, où latence d'inférence et longueur de séquence conditionnent le temps de cycle. Les résultats restent toutefois issus de bancs d'essai académiques, simulation complétée d'un nombre limité de tâches réelles, donc d'un stade de recherche et non d'un produit ou d'un déploiement industriel. Le travail s'inscrit dans la lignée des tokenizers développés pour les VLA récents, dont FAST, méthode associée à la famille de modèles Pi-0 de Physical Intelligence et prise ici comme référence de comparaison, ainsi que les approches par binning et par quantification vectorielle discrète plus anciennes. L'idée de recycler les codecs audio neuronaux à quantification résiduelle, déjà standard pour les modèles de fondation audio, illustre une tendance plus large du secteur à importer des briques génératives multimodales vers la robotique. Publiée sous forme de préprint arXiv, sans annonce de licence, d'intégration produit ni de calendrier de déploiement, la contribution demeure un résultat de recherche dont la portée dépendra de sa reproduction sur des politiques VLA de plus grande échelle et de tests au-delà des bancs d'essai contrôlés utilisés dans l'article.

RechercheActu
1 source
Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique
3arXiv cs.RO 

Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique

Des chercheurs ont publié sur arXiv (référence 2604.15215v2) un travail portant sur HiST-AT, un tokeniseur d'actions hiérarchique et spatiotemporel conçu pour l'apprentissage par imitation en contexte. Le principe central repose sur deux niveaux successifs de quantification vectorielle : le premier niveau affecte chaque action à des sous-clusters fins, tandis que le second regroupe ces sous-clusters en clusters plus larges. L'extension spatiotemporelle va plus loin en récupérant simultanément les actions et leurs horodatages associés, permettant au modèle d'exploiter à la fois la géométrie des mouvements et leur séquençage temporel. Les évaluations ont été conduites sur plusieurs benchmarks de manipulation robotique en simulation et en conditions réelles, et les auteurs revendiquent un nouveau niveau de performance de référence sur les tâches d'apprentissage par imitation en contexte. Ce résultat intéresse directement les équipes qui travaillent sur le déploiement rapide de robots dans de nouvelles tâches industrielles sans collecter des milliers de démonstrations. L'apprentissage par imitation en contexte, calqué sur le few-shot prompting des grands modèles de langage, vise à permettre à un robot d'exécuter une nouvelle tâche à partir de quelques exemples fournis dynamiquement, sans réentraînement. La qualité du tokeniseur d'actions est ici le maillon critique : une discrétisation trop grossière des trajectoires efface l'information fine de manipulation ; trop granulaire, elle rend l'espace de tokens ingérable. Le fait que l'approche hiérarchique améliore les résultats par rapport à une quantification à un seul niveau, et que l'ajout de l'information temporelle amplifie encore ce gain, suggère que la structure latente des tâches de manipulation est intrinsèquement multiscale. L'apprentissage par imitation en contexte pour la robotique s'est fortement développé depuis 2023, porté par des modèles comme ACT, Diffusion Policy, et plus récemment les architectures de type VLA (Vision-Language-Action) telles que OpenVLA, pi-zero de Physical Intelligence ou GR00T N2 de NVIDIA. La tokenisation des actions est un point de friction commun à toutes ces approches : comment convertir des trajectoires continues en séquences discrètes manipulables par un transformer. HiST-AT apporte une réponse structurée à ce problème, mais il s'agit à ce stade d'un résultat de recherche publié en preprint, sans validation industrielle ni déploiement annoncé. Les prochaines étapes naturelles seront d'évaluer la robustesse en dehors des benchmarks académiques, notamment sur des tâches de manipulation à haute fréquence ou en environnement non contrôlé.

RechercheOpinion
1 source
CAP : prédiction alignée sur le codebook pour les politiques robotiques tokenisées
4arXiv cs.RO 

CAP : prédiction alignée sur le codebook pour les politiques robotiques tokenisées

Des chercheurs ont publié sur arXiv (identifiant 2610.09178) une méthode baptisée CAP, pour Codebook-Aligned Prediction, destinée aux politiques robotiques fondées sur la tokenisation d'actions. Cette tokenisation convertit des actions continues en symboles discrets, qu'un modèle prédit ensuite de façon autorégressive, à la manière d'un modèle de langage. Dans les approches actuelles, une fois les actions tokenisées, la politique traite les tokens comme des indices de classes sans lien entre eux et entraîne à partir de zéro un classifieur dédié. CAP change ce point précis : la tête de prédiction réutilise directement les vecteurs du codebook du tokenizer comme prototypes de classes. Le tokenizer et le backbone de la politique restent inchangés, tout comme la qualité de reconstruction. Les auteurs ont testé la méthode sur quatre familles de quantificateurs, trois benchmarks en simulation et deux tâches sur robot réel. Ils rapportent une amélioration constante du taux de réussite par rapport aux têtes de classification standard. Le résumé ne donne ni gain chiffré ni nom de modèle ou de robot. L'intérêt tient à l'explication avancée par les auteurs. Selon leur analyse, le gain ne vient ni d'une meilleure précision de prédiction des tokens, ni d'un simple changement de tête. Il vient de l'information de structure latente que le codebook transmet à la politique. Deux effets sont décrits. Les erreurs de prédiction deviennent plus bénignes dans l'espace des actions, car un token voisin dans le codebook correspond à une action voisine. Les représentations apprises par le backbone s'améliorent aussi. Pour un ingénieur ou un intégrateur, le message est pratique : la précision top-1 sur les tokens est une mesure trompeuse de la qualité d'une politique, et le tokenizer mérite d'être traité comme un composant qui structure l'apprentissage, pas comme une simple étape de prétraitement. Le coût d'adoption paraît faible, puisque la modification ne touche que la tête de sortie. Il faut toutefois rester prudent : il s'agit d'un preprint, sans revue par les pairs. Les deux tâches réelles ne disent rien de la tenue de la méthode à l'échelle des grands modèles généralistes, et l'ampleur des gains reste à vérifier dans le texte complet. Ce travail s'inscrit dans le courant des modèles vision-langage-action (VLA) qui discrétisent les actions. Cette ligne de recherche s'est popularisée avec des approches comme RT-2 et OpenVLA, puis avec les tokenizers d'actions compressés de type FAST, chez Physical Intelligence, qui concurrencent les politiques à diffusion ou à flow matching, comme Pi-0. Ces dernières génèrent des actions continues. Les tokenizers reposent sur divers quantificateurs, notamment la quantification vectorielle et la quantification scalaire finie, ce qui explique le choix de tester quatre familles. CAP défend l'idée que l'approche discrète peut gagner en efficacité sans repenser les tokenizers existants, ce qui pourrait réduire l'écart de performance avec les têtes continues. Les prochaines étapes à surveiller sont une validation sur des VLA de grande taille, des comparaisons directes avec les têtes à diffusion, et une éventuelle publication du code permettant une reproduction indépendante.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source