
OpenWAM : un cadre ouvert pour des modèles monde-action composables
OpenWAM est un cadre open source de modèles monde-action (WAM, world-action models), ces systèmes qui couplent la prédiction vidéo du futur au contrôle d'un robot. Les auteurs partent de Wan2.2-5B, un modèle de génération vidéo de 5 milliards de paramètres, qu'ils pré-entraînent de façon causale sur plus de 10 000 heures de vidéo robotique. Ils y greffent un « expert d'action » via une architecture Mixture-of-Transformers partagée. Celle-ci permet quatre modes de génération : conjointe, vidéo puis action, action puis vidéo, et découplée. Sur les quatre suites du benchmark de simulation LIBERO, le système obtient des taux de réussite élevés, de même que sur des tâches bimanuelles réelles dont l'abstract ne détaille ni le nombre ni les conditions. L'adaptation causale conjuguée à l'entraînement sur vidéo robotique fait passer le taux de réussite en mode vidéo puis action sur LIBERO-Long de 68,4 % à 97,8 %.
L'apport principal tient à la méthode plus qu'à un score. Les WAM existants changent simultanément de backbone vidéo, de structure d'interaction, de supervision et de procédure d'inférence, ce qui empêche d'attribuer un gain à un choix de conception précis. OpenWAM fournit un banc d'essai commun où l'on ne modifie qu'un paramètre à la fois. Les résultats sur la dynamique sont les plus intéressants pour les équipes qui cherchent à réduire leur dépendance aux démonstrations coûteuses. Quand seul le prédicteur vidéo est adapté à une nouvelle tâche, un modèle de dynamique inverse gelé, à contexte local, entraîné sur des transitions contrefactuelles et des démonstrations, atteint 84,0 % de réussite moyenne sur quatre tâches LIBERO-90 jamais vues. Le même modèle entraîné sur les seules démonstrations plafonne à 21,5 %, et une version à contexte complet atteint 47,0 %. En dynamique directe, la supervision contrefactuelle réduit l'erreur de prédiction RGB de 34,5 % et fait passer l'identification du bon résultat de 21,1 % à 71,3 % parmi 16 issues partant du même état. Ces chiffres viennent de LIBERO, un benchmark simulé et saturé, et d'un article non encore évalué par des pairs : ils ne disent rien du fossé entre démonstration et déploiement industriel.
Ce travail s'inscrit dans la montée des politiques fondées sur la vidéo, qui font concurrence aux modèles vision-langage-action (VLA) classiques comme Pi-0 ou GR00T. Leur promesse est de tirer parti de la grande quantité de vidéo disponible, au-delà des seules démonstrations réussies. Wan2.2 sert ici de socle, ce qui illustre la réutilisation des modèles vidéo génératifs ouverts en robotique. Le cadre est publié sous le numéro arXiv 2610.07922, en version 1, et l'abstract ne mentionne aucun pilote industriel ni calendrier de déploiement. La suite logique serait une validation sur davantage de tâches réelles, avec des comparaisons à poids de calcul équivalent contre les VLA établis.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



