WAM-Cache : réutilisation du cache KV à obsolescence bornée pour des modèles du monde et d'action efficaces
Des chercheurs publient WAM-Cache, un cadre d'accélération sans entraînement pour les World Action Models (WAMs). Ces modèles de manipulation généraliste conditionnent un « action expert » sur les représentations d'un Diffusion Transformer (DiT) vidéo préentraîné. En boucle fermée, ce DiT vidéo s'exécute à chaque « chunk » d'actions. Il encode l'observation courante en paires clé-valeur (KV) par couche, que l'action expert interroge ensuite. Ce préremplissage (prefill) domine le coût de calcul par chunk, et les accélérations existantes sans entraînement le laissent entièrement dense. WAM-Cache conserve les représentations KV d'un chunk à l'autre et ne recalcule qu'un sous-ensemble épars de tokens. Sur Fast-WAM, le prefill du DiT vidéo perd 32 à 42 % de FLOPs sur RoboTwin 2.0, LIBERO et en expérimentation réelle. La perte reste de 0,7 à 1,8 point de pourcentage par rapport à la politique dense en simulation, et de 2,5 points sur robot réel. Il s'agit d'un résultat de recherche (preprint arXiv), sans produit ni déploiement industriel associé.
L'enjeu tient à la méthode de sélection autant qu'au gain de calcul. Les auteurs montrent que l'heuristique intuitive, qui rafraîchit les tokens ayant visuellement bougé, plafonne nettement sous la politique dense, même avec un oracle qui prédirait la dérive réelle des KV. La précision des actions dépend de l'endroit où l'action expert porte son attention, pas de ce qui a changé dans l'image. Cela compte pour quiconque cherche à faire tourner des politiques fondées sur la vidéo en temps réel sur du matériel embarqué, où la latence et la consommation limitent le déploiement. Un gain de 32 à 42 % sur la partie dominante du coût est utile, mais il reste modeste et ne fait pas à lui seul passer ces modèles à l'échelle industrielle. Les chiffres portent sur Fast-WAM et sur des benchmarks de simulation, plus une évaluation réelle dont l'ampleur n'est pas précisée dans le résumé. Le coût de 2,5 points en réel est plus élevé qu'en simulation et mérite d'être vérifié sur des tâches plus variées.
WAM-Cache sélectionne l'ensemble de rafraîchissement en combinant la cross-attention de l'action expert et la « surprise latente » visuelle. Une borne stricte d'âge limite l'accumulation d'erreurs : un token ne peut pas rester périmé au-delà d'un seuil. Le travail s'inscrit dans la tendance des WAMs, qui exploitent les priors de dynamique des modèles vidéo pour piloter la manipulation, face aux VLA plus classiques comme Pi-0 ou GR00T. Il prolonge aussi les techniques de cache KV et de réutilisation de calcul connues pour les LLM et les DiT, ici adaptées à un contrôle en boucle fermée. Comme la méthode ne demande aucun réentraînement, elle peut en principe s'appliquer à d'autres WAMs. Cela reste à démontrer, car les résultats publiés ne concernent que Fast-WAM. Aucune date de code ou de publication de modèle n'est mentionnée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




