Video Prediction Policy 2 : mieux prédire pour mieux agir
Video Prediction Policy 2 (VPP2) est une nouvelle politique robotique de type « world action model » (WAM), décrite dans un preprint arXiv (2610.10270v1). Ces modèles cherchent à transférer les connaissances acquises par les modèles de prédiction vidéo vers l'apprentissage d'actions. Les auteurs constatent que les WAM existants produisent souvent des prédictions de mouvement erronées en environnement ouvert, ce qui entraîne des actions fausses. Ils l'expliquent par deux causes : les modèles vidéo de base ne sont pas optimisés pour la manipulation, et l'ajout naïf de composantes d'action à un modèle vidéo dégrade nettement sa capacité de généralisation. VPP2 procède en trois étapes. D'abord, un grand jeu de données varié de vidéos de manipulation, annotées avec des légendes détaillées, sert à poursuivre le pré-entraînement du modèle vidéo fondation, avec une approche dite « au niveau de l'événement ». Ensuite, ce modèle est post-entraîné puis distillé en un planificateur visuel en une seule étape, à horizon de prédiction fixe. Enfin, un module d'action, bâti sur une architecture mixture-of-transformers (MoT), apprend un modèle de dynamique inverse implicite.
Sur le plan des résultats, la version VPP2-14B (14 milliards de paramètres) dépasse Cosmos3-64B de 11,0 points de pourcentage en taux de réussite du suivi d'instruction en prédiction vidéo, sur des tâches ouvertes. Sur des tâches réelles de manipulation en zero-shot avec un robot ALOHA, VPP2 devance la meilleure référence de 18,5 points. Après un post-entraînement spécifique à chaque benchmark, il obtient les meilleurs taux de succès parmi les méthodes évaluées sur LIBERO-Pro, LIBERO-OOD et RoboDojo. Il s'agit de résultats de laboratoire issus d'un preprint non évalué par les pairs : les auteurs ne précisent pas, dans le résumé, le nombre d'essais, la nature des tâches ALOHA ni la taille des baselines hors Cosmos3. Aucun déploiement industriel n'est annoncé.
L'intérêt tient d'abord au diagnostic : la qualité de la prédiction vidéo conditionne directement celle de l'action. Le résultat suggère qu'un modèle de 14 milliards de paramètres, spécialisé par des données de manipulation, peut battre un modèle généraliste quatre fois plus gros, ce qui compte pour les équipes qui doivent faire tourner ces politiques sur du matériel embarqué. La distillation en une seule étape va dans le même sens, puisqu'elle réduit le coût d'inférence, un frein classique des approches fondées sur la diffusion vidéo. Pour les intégrateurs, le point à surveiller reste l'écart entre benchmarks et usage réel : LIBERO et ses variantes sont des environnements de simulation, et le seul test physique rapporté repose sur ALOHA, plateforme bimanuelle de recherche.
Ce travail prolonge la lignée Video Prediction Policy, qui utilisait déjà des modèles de diffusion vidéo pré-entraînés comme représentation pour piloter des politiques d'action. Il s'inscrit dans la course aux modèles du monde et aux VLA (vision-langage-action), face notamment aux approches de la famille Cosmos de NVIDIA, citée ici comme point de comparaison, et à d'autres politiques généralistes telles que Pi-0 ou GR00T. La suite dépendra de la publication éventuelle du code et des poids, de réplications indépendantes, et de tests sur des robots et des tâches industrielles au-delà des benchmarks académiques.
Dans nos dossiers



