
Modèle du monde ancré : planification latente guidée par des objectifs en langage naturel
Des chercheurs proposent le Grounded World Model (GWM), un modèle du monde latent qui permet de planifier en zero-shot, dans le monde réel, à partir d'une simple instruction en langage naturel. Les modèles précédents, comme DINO-WM et LeWM, exigent une image du but, difficile à obtenir à l'avance pour une tâche inédite. GWM, lui, prédit l'avenir dans l'espace visuel d'un modèle d'embedding vidéo-langage pré-entraîné, à partir d'une séquence d'actions candidate et de l'observation courante. La lecture figée de cet embedding projette le futur imaginé et la description de la tâche dans le même espace, et l'opposé de leur similarité cosinus sert de coût de planification. L'entraînement n'utilise que des paires vidéo-action hors ligne, sans lien avec une tâche précise, et aucune annotation linguistique. Sur le benchmark simulé WISER, la planification avec GWM résout 87 % de 288 tâches aux instructions et signaux visuels inédits, contre 22 % en moyenne pour dix VLA affinés. Avec des données de robots réels, sous IsaacSim, GWM réussit les 70 essais répartis sur 14 tâches de désignation par expressions référentielles, comme un planificateur modulaire guidé par un VLM de pointe, alors que pi0.5 en réussit 37 sur 70. Sur un bras Franka réel, le système complète 55 sous-tâches de pick-and-place sur 60, contre 52 sur 60 pour le planificateur modulaire.
Ces résultats déplacent le débat sur l'architecture des robots pilotés par le langage. Les VLA affinés dominent aujourd'hui les démonstrations, mais le contraste est net dès qu'on change les instructions ou les signaux visuels : 22 % contre 87 % suggère que la généralisation de ces politiques reste fragile hors distribution. À l'inverse, planifier en simulant des futurs et en les évaluant par similarité sémantique évite de réentraîner un modèle pour chaque tâche et ne demande aucune donnée annotée en langage, ce qui réduit un goulot d'étranglement de collecte. Pour un intégrateur, l'argument pratique est que l'ensemble tourne en local sur un seul GPU grand public, sans appel à un VLM propriétaire distant. Il faut toutefois rester prudent : les 60 essais réels portent sur des tâches de pick-and-place sur un seul type de bras, la différence avec le planificateur modulaire (55 contre 52) n'est pas significative statistiquement, et WISER est un benchmark conçu par les auteurs. Le temps de calcul par décision n'est pas détaillé dans le résumé.
Ce travail prolonge la lignée des modèles du monde latents pour la manipulation, portée par DINO-WM puis LeWM, en levant la contrainte du but visuel. Il se positionne face aux VLA généralistes comme pi0.5, et face aux architectures modulaires où un VLM de pointe décompose la tâche et un module de bas niveau l'exécute. La version 2 de l'article sur arXiv (2604.11751) et un site de projet sont disponibles, mais aucun déploiement industriel ni calendrier de transfert n'est annoncé. Les prochaines étapes probables sont des tests sur des tâches plus longues, des manipulations plus dextres et d'autres plateformes que le Franka, avant de savoir si cette approche tient hors du laboratoire.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




