MT-WAM : réorienter la représentation prédictive à passage unique vers la génération d'action
Publié sur arXiv en septembre 2026 (référence 2609.21474v1), MT-WAM fait évoluer le modèle Fast-WAM de contrôle robotique par apprentissage vidéo-action. Le système génère les actions à partir d'un unique passage avant dans un Transformer de diffusion vidéo, sans produire de vidéo future à l'inférence. MT-WAM y ajoute deux supervisions, prédiction de trajectoires de points 2D futurs et de caractéristiques visuelles futures, traitées par une branche légère à deux flux avec masque d'attention anti-interférence copiée depuis les derniers blocs du backbone vidéo. À l'inférence, seuls des caches vidéo et mouvement sont recalculés à chaque replanification, la prédiction vidéo future étant abandonnée. Résultat, sans pré-entraînement de politique supplémentaire : 98,2% de réussite sur LIBERO, 73,7% sur LIBERO-Plus (+23,8 points face à Fast-WAM), une hausse de 6,30% à 19,40% sur RoboTwin 2.0 en configuration Random, et de 67,0% à 77,8% en moyenne sur quatre tâches réelles.
L'enjeu dépasse la simple prouesse benchmark : les modèles de contrôle robotique de type VLA cherchent à exploiter une représentation vidéo pré-entraînée pour produire des actions fiables sans supporter le coût de calcul d'une génération vidéo complète à chaque inférence. En montrant qu'une supervision orientée vers la dynamique future et la structure visuelle améliore surtout la robustesse sur des variations non vues, comme le confirment les gains sur LIBERO-Plus et sur la configuration Random de RoboTwin, MT-WAM apporte un indice concret que les architectures façon Fast-WAM sous-exploitaient jusqu'ici leur propre représentation vidéo pour l'action, un point utile pour qui conçoit des politiques robotiques génériques à partir de backbones vidéo pré-entraînés plutôt que des politiques spécialisées entraînées de bout en bout.
MT-WAM se présente explicitement comme une extension de Fast-WAM, dont il reprend le principe fondateur : le co-entraînement vidéo-action améliore le contrôle sans nécessiter de génération vidéo à l'exécution. Classé en soumission croisée sur arXiv, le travail s'inscrit dans un courant de recherche actif sur les modèles de fondation robotiques combinant prédiction vidéo et génération d'action via des Transformers de diffusion. Les auteurs ne signalent ni partenariat industriel ni intégration produit : les résultats reposent sur des benchmarks de simulation reconnus (LIBERO, LIBERO-Plus, RoboTwin 2.0) et sur seulement quatre tâches réelles, ce qui invite à la prudence avant toute extrapolation à grande échelle. Aucune date de mise à disposition du code n'est mentionnée dans la publication.
Dans nos dossiers




