CAP : prédiction alignée sur le codebook pour les politiques robotiques tokenisées
Des chercheurs ont publié sur arXiv (identifiant 2610.09178) une méthode baptisée CAP, pour Codebook-Aligned Prediction, destinée aux politiques robotiques fondées sur la tokenisation d'actions. Cette tokenisation convertit des actions continues en symboles discrets, qu'un modèle prédit ensuite de façon autorégressive, à la manière d'un modèle de langage. Dans les approches actuelles, une fois les actions tokenisées, la politique traite les tokens comme des indices de classes sans lien entre eux et entraîne à partir de zéro un classifieur dédié. CAP change ce point précis : la tête de prédiction réutilise directement les vecteurs du codebook du tokenizer comme prototypes de classes. Le tokenizer et le backbone de la politique restent inchangés, tout comme la qualité de reconstruction. Les auteurs ont testé la méthode sur quatre familles de quantificateurs, trois benchmarks en simulation et deux tâches sur robot réel. Ils rapportent une amélioration constante du taux de réussite par rapport aux têtes de classification standard. Le résumé ne donne ni gain chiffré ni nom de modèle ou de robot.
L'intérêt tient à l'explication avancée par les auteurs. Selon leur analyse, le gain ne vient ni d'une meilleure précision de prédiction des tokens, ni d'un simple changement de tête. Il vient de l'information de structure latente que le codebook transmet à la politique. Deux effets sont décrits. Les erreurs de prédiction deviennent plus bénignes dans l'espace des actions, car un token voisin dans le codebook correspond à une action voisine. Les représentations apprises par le backbone s'améliorent aussi. Pour un ingénieur ou un intégrateur, le message est pratique : la précision top-1 sur les tokens est une mesure trompeuse de la qualité d'une politique, et le tokenizer mérite d'être traité comme un composant qui structure l'apprentissage, pas comme une simple étape de prétraitement. Le coût d'adoption paraît faible, puisque la modification ne touche que la tête de sortie. Il faut toutefois rester prudent : il s'agit d'un preprint, sans revue par les pairs. Les deux tâches réelles ne disent rien de la tenue de la méthode à l'échelle des grands modèles généralistes, et l'ampleur des gains reste à vérifier dans le texte complet.
Ce travail s'inscrit dans le courant des modèles vision-langage-action (VLA) qui discrétisent les actions. Cette ligne de recherche s'est popularisée avec des approches comme RT-2 et OpenVLA, puis avec les tokenizers d'actions compressés de type FAST, chez Physical Intelligence, qui concurrencent les politiques à diffusion ou à flow matching, comme Pi-0. Ces dernières génèrent des actions continues. Les tokenizers reposent sur divers quantificateurs, notamment la quantification vectorielle et la quantification scalaire finie, ce qui explique le choix de tester quatre familles. CAP défend l'idée que l'approche discrète peut gagner en efficacité sans repenser les tokenizers existants, ce qui pourrait réduire l'écart de performance avec les têtes continues. Les prochaines étapes à surveiller sont une validation sur des VLA de grande taille, des comparaisons directes avec les têtes à diffusion, et une éventuelle publication du code permettant une reproduction indépendante.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



