DreamTrue : un modèle du monde robotique fidèle aux actions, grâce à un post-entraînement contrefactuel
DreamTrue, un modèle du monde pour robots publié sur arXiv (2610.12468), vise à prédire des vidéos fidèles aux actions commandées et physiquement plausibles. Il est multi-vues et inter-embodiments, c'est-à-dire entraîné pour fonctionner sur plusieurs types de robots. Les auteurs, regroupés derrière la page projet brave-eai, partent de deux obstacles des jeux de données robotiques existants. Une calibration imprécise dégrade le suivi des actions. Une couverture limitée des interactions ratées biaise les prédictions vers des issues réussies. Pour y répondre, l'équipe projette les trajectoires d'actions en conditions dans l'espace image, puis applique une calibration géométrique hors ligne qui les aligne sur les vidéos cibles. Elle ajoute un post-entraînement contrefactuel, qui modifie les trajectoires enregistrées et génère les vidéos futures sous un éventail plus large d'actions et de configurations de contact. Faute de vérité terrain appariée pour ces futurs, elle a construit un jeu de vidéos annotées par des humains, couvrant les défauts du robot, des objets et de l'interaction. Il sert à entraîner un modèle de récompense vidéo incarné, dont les scores guident un post-entraînement par apprentissage par renforcement. Sur la plateforme AgiBot, DreamTrue annonce l'état de l'art en suivi d'actions et fait passer le taux de défauts d'interaction, évalué par des humains, de 48,12 % à 6,25 %. Il se classe premier de la piste « world model » de l'AgiBot World Challenge 2026.
L'enjeu dépasse le classement. Les modèles du monde servent de plus en plus de simulateurs appris pour évaluer des politiques, générer des données synthétiques ou planifier, et leur défaut majeur est l'optimisme : un modèle entraîné surtout sur des démonstrations réussies « hallucine » des saisies qui aboutissent, même quand l'action commandée devrait échouer. Un tel biais rend le modèle inutile pour tester une politique, puisqu'il ne reproduit pas les échecs. L'approche contrefactuelle, couplée à une récompense apprise sur des défauts annotés, s'attaque directement à ce problème. La baisse de 48 % à 6 % est spectaculaire, mais elle repose sur une évaluation humaine dont le protocole, la taille d'échantillon et la définition des défauts restent à examiner. Elle est mesurée sur un seul robot, ce qui laisse ouverte la généralisation inter-embodiments revendiquée. Il s'agit par ailleurs d'un préprint, sans déploiement réel ni usage en boucle fermée démontré.
Le travail s'inscrit dans la course aux modèles du monde robotiques, où se côtoient des systèmes de type Cosmos de NVIDIA, Genie de Google DeepMind et les efforts autour des jeux de données AgiBot World. AgiBot, le constructeur chinois, utilise son challenge pour fédérer la recherche autour de sa plateforme et de ses données, ce qui oriente aussi les résultats vers son matériel. Les suites logiques sont la publication du code et des poids, une validation sur d'autres robots, et surtout la preuve qu'un modèle du monde ainsi calibré classe correctement des politiques réelles, ce qui reste le test décisif pour les intégrateurs et les équipes de recherche.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




