MoWAM : prédiction explicite du mouvement futur pour des modèles monde-action efficaces
Un nouveau papier de recherche publié sur arXiv (référence 2609.20709v1) présente MoWAM, un modèle d'action du monde, ou World Action Model (WAM), destiné à l'apprentissage de politiques robotiques pour la manipulation. Contrairement aux WAM classiques qui génèrent explicitement des vidéos du futur pendant l'inférence pour anticiper la dynamique de l'environnement, ce qui alourdit considérablement le calcul, MoWAM remplace cette génération vidéo par une prédiction explicite du mouvement futur du robot. Le système repose sur une architecture Mixture-of-Transformer qui apprend la dynamique visuelle future pendant l'entraînement tout en prédisant conjointement mouvement et action, ce qui permet de supprimer entièrement la génération vidéo au moment de l'inférence tout en conservant une représentation explicite du futur. Les auteurs ont évalué le modèle sur les bancs d'essai de simulation LIBERO et LIBERO-Plus ainsi que sur des tâches de manipulation en conditions réelles.
Le papier s'attaque à un compromis classique du secteur: retirer la génération vidéo future accélère l'inférence, mais risque de ne laisser la dynamique future qu'implicitement encodée dans les caractéristiques d'observation, ce qui fragilise les politiques face aux changements de distribution, un problème central pour tout intégrateur déployant un robot hors du cadre exact de son entraînement. En modélisant le mouvement comme une abstraction compacte du futur, MoWAM revendique une performance solide en distribution, une robustesse accrue hors distribution, et un taux de succès moyen supérieur en conditions réelles face à des WAM de référence. Point notable pour la mise à l'échelle au moment de l'inférence: la représentation compacte du mouvement permet d'échantillonner plusieurs candidats de paires mouvement-action et de les départager via un vérificateur de progression de tâche, avec des gains de performance croissants à mesure que davantage de candidats sont explorés, un signal que l'inférence-time scaling, déjà exploité pour les grands modèles de langage, commence à trouver une traduction concrète en robotique manipulatrice.
MoWAM s'inscrit dans la lignée des World Action Models, qui enrichissent l'apprentissage de politiques robotiques d'une anticipation de la dynamique future, en complément des approches vision-langage-action plus directes. Il s'agit ici d'une contribution de recherche évaluée sur des bancs d'essai standards et un nombre limité de tâches réelles, sans acteur industriel, calendrier de déploiement, coûts ni volumes annoncés. L'argument central, à savoir qu'une modélisation explicite mais compacte du mouvement futur peut remplacer la coûteuse génération vidéo sans sacrifier la robustesse, mérite d'être suivi à mesure que des équipes tenteront de le reproduire sur des politiques robotiques destinées à la production plutôt qu'à la démonstration.
Dans nos dossiers




