MVG-WAM : modélisation monde-action intégrant la géométrie multi-vues pour la manipulation robotique
Des chercheurs publient MVG-WAM (Multi-View Geometry-Aware World-Action Model), un modèle monde-action pour la manipulation robotique, décrit dans le preprint arXiv 2609.37793. Il repose sur un modèle vidéo pré-entraîné qui prédit à la fois la dynamique visuelle et les actions. Le modèle atteint 99,1 % de réussite moyenne sur LIBERO et 92,07 % sur RoboTwin 2.0. En conditions réelles, il obtient 91,3 % de succès sur 150 essais répartis sur trois tâches, avec la plateforme bimanuelle Cobot Magic. Le résumé ne détaille ni les tâches, ni le nombre d'essais par tâche, ni la comparaison avec des modèles concurrents. Il ne s'agit ni d'un produit ni d'un déploiement, mais d'un résultat de recherche.
Les World-Action Models (WAM) exploitent les connaissances visuelles des modèles vidéo pour piloter des bras robotiques. Leur point faible est l'interface multi-caméras. Les images synchronisées sont en général juxtaposées en mosaïque, ou leurs tokens sont concaténés. Les relations géométriques entre caméras restent donc implicites, ce qui complique le lien entre le contexte global de la scène et la géométrie locale nécessaire au contact. MVG-WAM traite les vues comme des projections d'un même monde physique. Il combine un état global contraint par la géométrie épipolaire avec des états géométriques propres à chaque vue. Un routage sensible aux caméras fournit à chaque région vidéo son contexte géométrique et l'état global partagé. Le modèle est aussi ancré à l'échelle métrique par une supervision de profondeur future à plusieurs horizons, sans décodage de profondeur pendant l'exécution des actions. Le coût d'inférence n'augmente donc pas.
Ces résultats situent MVG-WAM dans la course aux politiques généralistes issues de modèles vidéo, face aux VLA (vision-langage-action) comme Pi-0 ou GR00T. Il faut relativiser les scores. LIBERO est quasi saturé, avec des performances proches de 99 % pour plusieurs méthodes, et il discrimine donc peu. RoboTwin 2.0 est un benchmark de simulation bimanuelle plus exigeant. Le test réel de 150 essais reste modeste, sur un seul robot, et sans détail sur les conditions ni les échecs. L'écart entre benchmark et terrain n'est donc pas mesuré. Pour les intégrateurs, l'intérêt est ailleurs. Les configurations multi-caméras sont la norme en atelier, et une représentation qui exploite explicitement la calibration pourrait améliorer la précision sans capteurs supplémentaires. Reste à savoir si le gain se confirme sur des scènes non vues et des cadences industrielles.
Ce travail prolonge la vague des modèles monde-action, qui greffent la prédiction vidéo sur le contrôle robotique, en parallèle des VLA fondés sur des modèles vision-langage. Ces deux approches se disputent la position de fondation pour la manipulation. Le preprint n'annonce ni code, ni calendrier, ni pilote industriel, et n'a pas été relu par des pairs. La suite logique serait une évaluation sur d'autres plateformes, des tâches plus longues et des comparaisons directes avec les VLA et WAM de référence.
Pas d\'impact direct sur la France/UE




