
Video2World : un banc d'essai d'agents de code pour la modélisation interactive du monde à partir de vidéos incarnées
Une équipe de chercheurs publie Video2World, un benchmark qui teste si des agents de code adossés à des modèles de fondation peuvent transformer une vidéo embodied en simulateur interactif, sans intervention humaine. La tâche, baptisée « vidéo-to-simulation autonome », est posée comme un problème d'ingénierie logicielle. L'agent observe une vidéo de démonstration (robot ou humain), construit l'environnement simulé et le comportement du robot correspondants, puis affine le résultat grâce au retour d'exécution. Le benchmark compte 222 instances de reconstruction issues de 189 vidéos. Il note les mondes reconstruits selon trois axes : la fidélité géométrique (perception spatiale), la fidélité dynamique (raisonnement physique) et la justesse fonctionnelle (capacité à exécuter une interaction). Neuf systèmes d'agents de code de pointe ont été évalués. Le taux de réussite de la tâche passe de moins de 5 % à plus de 15 % à partir de Claude Opus 5. L'écart avec une reconstruction assistée par des humains reste important.
L'enjeu est direct pour quiconque produit des données d'entraînement pour la robotique. Aujourd'hui, construire un environnement de simulation à partir d'observations réelles demande beaucoup de travail manuel, de modélisation de scène et de calibration. C'est un goulot d'étranglement pour passer à l'échelle des données embodied, par exemple pour entraîner des politiques VLA (vision-langage-action) ou générer des jeux de test reproductibles. Le saut observé suggère que les capacités de génie logiciel agentique commencent à toucher ce problème, mais un taux de succès d'environ 15 % reste très loin d'un pipeline industriel fiable. Le résultat le plus instructif est ailleurs : les mondes qui paraissent meilleurs ne fonctionnent pas forcément mieux, et une fidélité visuelle accrue ne garantit pas un meilleur taux de réussite. Cela rappelle l'écart, déjà connu avec les modèles génératifs, entre réalisme perceptif et exactitude factuelle. Pour les équipes qui évaluent des « world models » ou des simulateurs générés, juger sur le rendu est donc un mauvais indicateur, et il faut mesurer la dynamique et l'exécution.
Ce travail s'inscrit dans la course à l'automatisation de la création de simulateurs, où se croisent les modèles de monde génératifs vidéo, les pipelines de reconstruction 3D et les approches « real-to-sim » encore très manuelles. Le choix de cadrer le problème comme une tâche d'agent de code, avec boucle d'exécution et correction, déplace la question de la génération de pixels vers la production de code de simulation exécutable. Il s'agit d'une publication académique sur arXiv (v2) et non d'un produit livré : aucun déploiement industriel ni acteur européen n'est mentionné dans le résumé. Les suites probables sont l'évaluation de nouveaux agents sur le benchmark, la mesure de l'écart restant avec les humains et, à terme, l'usage de ces mondes reconstruits pour générer des données d'entraînement. La preuve que ces mondes améliorent réellement des politiques robotiques reste à apporter.
Dans nos dossiers




