Les modèles du monde rendent-ils les robots meilleurs ? Un panorama des benchmarks d'évaluation pour l'IA incarnée prédictive
Une synthèse déposée sur arXiv fin septembre 2026 recense et vérifie une par une 160 benchmarks d'évaluation robotique publiés entre 2017 et 2026, dans le but de déterminer si les modèles du monde (world models), qui prédisent les observations futures, offrent un avantage mesurable en boucle fermée face aux politiques vision-langage-action (VLA), qui associent directement l'observation à l'action. Les 160 bancs d'essai sont répartis en quatre familles : suites d'évaluation de politiques, agents incarnés, évaluation pure des world models, et ponts prédiction-vers-action. Le bilan chiffré est net : 138 benchmarks sur 160, soit 86%, restent agnostiques au type de modèle, 11 seulement (7%) construisent une comparaison explicite VLA contre world model, et 4 seulement transforment une prédiction en action réellement exécutée sur un robot. La capacité contrefactuelle, c'est-à-dire anticiper ce qui se passerait sous une action alternative, n'est quasiment jamais mesurée dans l'ensemble du corpus étudié.
Ce travail met en lumière un angle mort structurel du secteur : il est aujourd'hui impossible de trancher, preuves à l'appui, si entraîner un robot à prédire l'avenir améliore réellement ses performances en boucle fermée par rapport à une politique VLA directe. Les benchmarks de world models jugent la qualité de la prédiction sans jamais l'exécuter, tandis que les suites de succès de tâche n'hébergent qu'une seule politique à la fois et ne construisent jamais ce contraste. Pour les intégrateurs et décideurs qui arbitrent entre paradigmes de recherche et priorités d'investissement, la leçon est de rester prudent face aux annonces autour des world models : générer des vidéos futures convaincantes ne prouve aucun gain réel de succès de tâche en conditions réelles, faute de protocole capable d'isoler cet avantage.
Ce fossé méthodologique vient du fait que les deux courants de recherche se sont développés en parallèle sans jamais vraiment se confronter, les politiques VLA étant jugées en boucle fermée sur le taux de réussite de tâches concrètes, les modèles du monde en boucle ouverte sur la seule qualité de leurs prédictions ou générations. Face à ce vide, les auteurs comparent leur couverture à celle des huit enquêtes les plus proches déjà publiées et revendiquent être les seuls à croiser capacité robotique et famille de modèle. Ils proposent une taxonomie opérationnelle des 160 bancs d'essai, une boucle d'évaluation conçue pour isoler spécifiquement l'avantage de la prédiction, et un protocole de quatre métriques ancrées sur des bancs d'essai nommés. Leur conclusion n'est pas que les world models aident ou non les robots, mais que répondre à cette question exige de construire des benchmarks conçus spécifiquement pour la poser.
Dans nos dossiers




