Les limites de planification des modèles du monde latents
Une étude publiée sur arXiv (2609.39235) cartographie les limites de planification des modèles du monde latents, ces prédicteurs censés permettre à un robot d'« imaginer » l'évolution de son environnement avant d'agir. Les auteurs construisent des prédicteurs conditionnés par l'action sur cinq encodeurs visuels auto-supervisés gelés : V-JEPA 2, V-JEPA 2.1, VideoMAEv2, VideoPrism et DINOv2. Ils les évaluent sur diverses tâches de manipulation Meta-World et sur des interactions réelles tirées de BridgeData V2. Avec des rollouts de cinq pas, longueur d'entraînement du prédicteur, le modèle ne classe correctement les actions que pour des cibles situées 5 à 10 pas de contrôle plus loin, alors que les objectifs des tâches se trouvent à 16 à 53 pas. Un prédicteur 81 fois plus grand ou un entraînement sur des rollouts plus longs n'étendent pas cette portée. L'encodeur, lui, influence la portée et le succès en boucle fermée, V-JEPA 2.1 se montrant le plus régulier.
Le point le plus significatif est que cette limite ne vient pas d'une prédiction imparfaite. Avec le vrai simulateur, donc une prédiction parfaite, le succès tombe de 92 % à 41 % lorsque la cible passe de 5 à 20 pas au-delà d'un rollout de cinq pas. Le goulet d'étranglement est donc la structure de la planification, pas seulement la qualité du modèle. Pour des objectifs lointains, l'imagination pure réussit dans 23 % des épisodes, la planification avec retour d'information (MPC) monte à 30 %, un rollout aussi long que la distance à l'objectif atteint 47 %, et des sous-objectifs experts proches atteignent 76 %. Pour les intégrateurs et les équipes R&D, cela tempère l'idée qu'il suffit de grossir le modèle ou les données : il faut des horizons imaginés plus longs ou une décomposition hiérarchique en sous-objectifs. Cela invite aussi à lire avec prudence les démonstrations qui montrent ce que ces modèles réussissent sans préciser à quelle distance se trouvait le but.
L'étude arrive alors que les modèles du monde de la famille JEPA, portés par Meta, sont présentés comme une voie vers des robots généralistes, en concurrence avec les approches VLA (vision-langage-action) qui prédisent directement les actions. Les auteurs montrent une complémentarité : dans sa plage de planification, un modèle du monde peut filtrer huit actions proposées par une politique VLA et faire passer son succès de 65 % à 77 % sur 16 tâches. Il s'agit de résultats académiques, en simulation et sur données robotiques existantes, sans déploiement industriel ni produit annoncé. Les suites probables portent sur des rollouts plus longs, des sous-objectifs générés automatiquement et l'intégration à des VLA, sans calendrier précisé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




