Sparse-WAM : accélérer les modèles monde-action grâce à une imagination parcimonieuse guidée par l'action
Des chercheurs proposent Sparse-WAM, un cadre sans entraînement qui accélère l'inférence des « world-action models » (WAMs), ces modèles de contrôle robotique qui s'appuient sur des modèles vidéo pré-entraînés pour prédire conjointement les images futures et les actions. Le coût vient du débruitage : les jetons de frames futures, très nombreux, sont retraités à chaque étape. Sparse-WAM ne traite qu'une partie d'entre eux, sélectionnés d'après leur pertinence pour l'action. Le module Action-Guided Token Selection conserve, pour chaque frame, les régions utiles à l'action, plus un contexte inter-frames. Un moteur nommé Pilot limite le surcoût du calcul des scores d'attention et du regroupement des jetons, grâce à un scoring léger et à la réutilisation des sélections d'une étape à l'autre. Sur LIBERO avec FastWAM-Joint, l'accélération atteint environ 2,0x par rapport à l'inférence dense « eager ». Sur RoboLab-120 avec Cosmos 3 Edge, elle atteint environ 1,8x. Les mesures ont été faites sur une NVIDIA RTX 4090, et les auteurs indiquent que la performance des tâches est « largement préservée ». Le papier (arXiv 2609.38984v1) ne donne pas, dans son résumé, l'ampleur exacte de la perte résiduelle.
Les WAMs promettent une meilleure généralisation que les politiques VLA classiques, mais leur latence est un obstacle au déploiement : un modèle vidéo de grande taille qui « imagine » le futur à chaque cycle de contrôle est difficile à tenir en temps réel sur du matériel embarqué ou abordable. Le travail vise ce point. Une carte grand public comme la RTX 4090 sert ici de référence, ce qui intéresse les intégrateurs qui n'ont pas de grappe de GPU de datacenter. Le gain est modeste (un facteur 2 au mieux) et ne règle pas à lui seul la fréquence de contrôle : la comparaison porte sur une base dense non optimisée, et non sur des moteurs d'inférence déjà très optimisés. Les benchmarks restent de la simulation ou des suites standardisées, sans validation sur robot réel annoncée. L'observation de fond est utile : l'attention des jetons d'action vers les frames futures se recouvre fortement d'un pas de débruitage à l'autre, alors que les représentations continuent d'évoluer. Cela suggère qu'une bonne part de l'« imagination » visuelle est redondante pour décider de l'action.
Ce travail s'inscrit dans la course à l'efficacité des modèles de diffusion vidéo, où l'élagage de jetons visait jusqu'ici la fidélité visuelle plutôt que la pertinence pour l'action. Il prolonge la lignée des politiques VLA et des modèles de monde, avec des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T, Cosmos) ou Figure (Helix), qui cherchent tous à concilier généralisation et latence. Aucun déploiement industriel n'est annoncé. La suite logique est de tester la méthode sur robot réel, de la combiner avec la quantification ou la distillation, et de vérifier qu'elle tient sur des tâches longues et des scènes moins contrôlées. Cette publication est un préprint, non évalué par des pairs.
Dans nos dossiers




