World Tokens : renforcer les politiques incarnées grâce à la modélisation du monde à l'entraînement
Des chercheurs présentent World Tokens, une architecture de politique incarnée publiée sur arXiv le 13 août 2026 (arXiv:2608.09730), qui greffe aux modèles vision-langage-action (VLA) un module appelé World Adapter. Celui-ci convertit les caractéristiques d'un modèle vision-langage en « world tokens » qui, pendant l'entraînement, conditionnent un débruiteur vidéo prédisant l'évolution de la scène tout en servant de seul contexte visuel à l'expert d'action. Au déploiement, cette branche vidéo est retirée : seuls le VLM, le World Adapter et l'expert d'action restent actifs, sans inférence vidéo en ligne. Avec un backbone de 2 milliards de paramètres et sans pré-entraînement d'action incarnée, le système se hisse au niveau des meilleures méthodes sur LIBERO, établit les meilleures moyennes rapportées sur SIMPLER, et améliore nettement le taux de réussite réel du robot R1 Pro face à une base « action seule » équivalente, à une latence comparable à celle d'un VLA standard.
Ce résultat s'attaque à un compromis central du secteur : les VLA classiques comme Pi-0, GR00T N2 ou Helix ignorent la dynamique physique explicite, tandis que les world-action models plus récents la capturent via des modèles vidéo préentraînés coûteux à exécuter dans la boucle de contrôle. En déplaçant cette modélisation du temps d'inférence vers le temps d'entraînement, World Tokens promet aux intégrateurs une compréhension plus fine du monde physique sans alourdir le temps de cycle ni le coût matériel au déploiement. C'est une piste concrète pour réduire l'écart souvent observé entre démonstrations impressionnantes et robustesse en conditions réelles, sans sacrifier la latence nécessaire à un déploiement de flotte à grande échelle.
Cette architecture s'inscrit dans la lignée des modèles VLA qui dominent le contrôle des robots manipulateurs et humanoïdes, et dans la vague plus récente des world-action models cherchant à leur ajouter une compréhension causale de la physique. Le papier, publié en cross-listing sur arXiv, reste une contribution de recherche testée sur les bancs d'essai standards LIBERO et SIMPLER ainsi que sur le robot réel R1 Pro, sans laboratoire ni entreprise explicitement rattachés dans le résumé. Les prochaines étapes attendues portent sur des backbones plus larges et davantage de plateformes robotiques réelles avant toute adoption industrielle.
Dans nos dossiers




