WorldScape Policy 2.0 : vers une modélisation d'action du monde pilotable grâce à une mémoire enrichie par le raisonnement
WorldScape Policy 2.0 est un nouveau modèle d'action du monde (World Action Model, WAM) publié en preprint sur arXiv, conçu pour la manipulation robotique par apprentissage conjoint des transitions visuelles et des actions du robot. Son architecture combine une mémoire visuelle causale à court terme, qui alimente le module de génération (DiT) avec les observations récentes pour préserver la dynamique locale d'interaction, et une mémoire d'événements à long et court terme, qui organise les sorties d'un modèle vision-langage en trois niveaux : historique global, activité locale et frontières d'événements. Cette mémoire récupérée sert de sous-objectif implicite pour la planification autonome, renforcé par un mécanisme de "semantic forcing" qui transfère la sémantique des instructions au niveau événementiel dans le flux de planification latent. Les auteurs introduisent également ManipEvent-5M, un jeu de données de pré-entraînement embarqué comptant près de 5 millions de segments d'événements, chacun aligné avec des trajectoires d'action, des instructions de tâche au niveau épisode, des légendes de sous-tâches au niveau segment, des images d'objectif et des démonstrations vidéo.
L'enjeu dépasse la seule prouesse technique : les modèles d'action du monde actuels souffrent d'un contexte temporel limité, d'une supervision par le langage trop grossière (au niveau de l'épisode entier) et d'un conditionnement quasi exclusivement textuel, ce qui limite le suivi de la progression des tâches, l'ancrage fin entre langage, vidéo et action, ainsi que le transfert entre différentes morphologies de robots. En proposant un conditionnement multimodal unifié, exploitable aussi bien par instruction de haut niveau que par image d'objectif ou contexte vidéo, WorldScape Policy 2.0 s'attaque directement à l'écart persistant entre démonstrations en laboratoire et exécution robuste sur des tâches longues et complexes, un point de friction central pour quiconque cherche à faire passer les architectures VLA (vision-langage-action) du prototype à un déploiement fiable.
Le papier s'inscrit dans la lignée des travaux récents qui cherchent à dépasser les VLA purement textuels en intégrant une mémoire structurée et une planification hiérarchique, plutôt que de simplement empiler davantage de données ou de paramètres. Les auteurs revendiquent des résultats supérieurs en simulation et sur plateformes réelles pour la planification autonome à long horizon, le suivi d'instructions fines et l'adaptation en contexte. Il s'agit à ce stade d'une contribution académique (article "new" sur arXiv), sans acteur industriel ni calendrier de déploiement associés : la validation par la communauté et la reproduction des résultats sur d'autres bancs de test restent les prochaines étapes attendues.
Dans nos dossiers




