MiniWAM : apprendre des cibles futures compactes pour une modélisation monde-action efficace
Des chercheurs présentent MiniWAM, un modèle « monde-action » (World Action Model, ou WAM) de 0,25 milliard de paramètres. Il prédit conjointement les actions d'un robot et une représentation compacte de l'état futur, au lieu des caractéristiques visuelles natives d'un encodeur pré-entraîné. Les WAM actuels prédisent généralement l'avenir dans l'espace de représentation de ces encodeurs, ce qui donne des cibles de grande dimension et coûteuses à entraîner. MiniWAM réduit le nombre de tokens de caractéristiques futures de 65 fois par rapport à une prédiction native, avec DINOv3 comme avec le VAE de WAN2.1. Les auteurs annoncent aussi un entraînement jusqu'à 8 fois plus rapide. Ces cibles compactes viennent d'un encodeur baptisé PRISM (Predictive Representations via Inverse Spatiotemporal Modeling). Il est appris sur des transitions privilégiées entre l'état courant et l'état futur. Il combine une supervision par dynamique inverse, qui cherche à retrouver l'action ayant produit la transition, et une reconstruction des caractéristiques. Une fois PRISM gelé, MiniWAM apprend à prédire ces cibles et les actions à partir des seules observations courantes. Les résultats sont donnés sur les benchmarks de simulation LIBERO, LIBERO-Plus et RoboTwin 2.0. Selon les auteurs, MiniWAM y surpasse systématiquement la prédiction de caractéristiques natives et reste compétitif face à des WAM nettement plus gros.
Pour les équipes qui entraînent des politiques robotiques, le résultat est surtout économique. L'hypothèse implicite de nombreux WAM veut que le co-entraînement par prédiction du futur exige de reconstruire ou prédire des représentations visuelles riches, donc de gros budgets de calcul. Ici, une cible bien choisie, qui retient l'information utile au contrôle plutôt que les détails de pixels ou de textures, donne de meilleurs résultats pour beaucoup moins de calcul. L'analyse des représentations va dans le même sens : PRISM apporterait une structure comportementale que la seule reconstruction de caractéristiques n'apporte pas. Une précaution s'impose. Toutes les évaluations citées sont en simulation, et rien n'indique de transfert sur robot réel, de temps de cycle ou de déploiement. Le taux de réussite sur des benchmarks déjà bien étudiés ne dit pas non plus comment la méthode se comporte en environnement non structuré. Le gain de 8 fois porte sur l'entraînement du modèle monde-action, pas sur la latence d'inférence.
Ces travaux s'inscrivent dans la montée des WAM, qui ont fait du modèle du monde un objectif de co-entraînement pour les politiques vision-langage-action (VLA). Cette approche concurrence les VLA purement réactifs, qui ne prédisent que l'action. Les WAM plus lourds restent la référence de comparaison, avec des dizaines de fois plus de paramètres. À 0,25B, MiniWAM vise un créneau plus accessible aux laboratoires universitaires et aux équipes à budget GPU limité. Le papier est une prépublication arXiv (v1), non relue par des pairs, et une page de projet accompagne le travail. La suite logique serait une validation sur matériel réel et une comparaison avec des politiques déjà déployées. Sans ces tests, l'efficacité observée en simulation ne garantit pas encore une valeur industrielle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



