
WorldToken : le temps d'abord dans la modélisation de séquences pour l'apprentissage par imitation robotique
Un article publié sur arXiv (2608.22591v1) présente WorldToken, une architecture "time-first" pour l'apprentissage par imitation en robotique. À chaque pas de décision, le système fusionne images multi-vues, proprioception et consigne de tâche en un "world token" unique, traité par un Transformer temporel causal couplé à une tête d'action par diffusion générant des séquences de mouvements. Sur 23 tâches du benchmark RoboCasa, une politique de 85,3 millions de paramètres, entraînée de zéro hormis un encodeur de texte CLIP pré-entraîné et gelé, atteint 59,45% de réussite moyenne en boucle fermée avec 2900 démonstrations générées par tâche. Une étude factorielle croisant cinq tailles de jeu de données, cinq tailles de modèle et deux graines d'entraînement montre des gains constants avec davantage de données mais des rendements décroissants au-delà d'une taille de modèle modérée.
Réduire l'historique temporel visible à un ou deux pas de temps dégrade la réussite en boucle fermée sur les 50 politiques RoboCasa testées. Sur RMBench Blocks Ranking, faire passer l'historique de 146 à 8 secondes fait chuter le taux de réussite évalué de 95% à 28%, tandis qu'un déploiement prolongé exploratoire maintient une séquence d'échange de référence pendant plus de 850 secondes. Pour les équipes développant des politiques VLA, ce résultat quantifie un arbitrage rarement mesuré aussi précisément: la longueur du contexte temporel pèse autant, voire plus, que la taille du modèle sur la réussite d'une tâche de manipulation, ce qui nuance l'idée que scaler les paramètres suffirait à améliorer la généralisation.
Les auteurs restent prudents sur la portée de leurs résultats: l'étude établit la faisabilité empirique de WorldToken et caractérise son comportement face au volume de données et au contexte temporel, sans démontrer sa supériorité sur d'autres organisations de séquence ni isoler quel composant précis explique les gains observés. Le travail s'appuie sur les bancs d'essai RoboCasa et RMBench et s'inscrit dans un débat plus large sur l'organisation temporelle des modèles vision-langage-action, aux côtés d'approches comme Pi-0, GR00T N2 ou Helix. Il s'agit d'un preprint de recherche, sans annonce de déploiement industriel ni de calendrier commercial.
Dans nos dossiers




