
AnyStep-WAM : distillation alignée sur le budget et inférence adaptative pour les modèles d'action du monde
Des chercheurs proposent AnyStep-WAM, un cadre qui rend ajustable le nombre d'étapes de débruitage des « world action models » (WAM). Ces modèles couplent une prédiction visuelle de la scène à la génération d'actions, et reposent aujourd'hui sur un débruitage itératif à nombre d'étapes fixe. La méthode combine deux briques. D'abord, une distillation « budget-aligned » à partir de trajectoires d'un modèle enseignant gelé, qui entraîne des flow maps conditionnées par l'intervalle de temps, avec des adaptateurs low-rank partagés. Le modèle peut ainsi générer des actions en une seule étape ou en plusieurs étapes de raffinement. Ensuite, un ordonnanceur léger « risque-bénéfice » estime, à partir d'un unique aperçu en une étape, la difficulté de la scène (courbure de la trajectoire de l'enseignant) et la fidélité attendue de l'élève pour chaque budget. Il retient le plus petit budget qui satisfait l'exigence de fidélité adaptée au risque. Les tests portent sur trois WAM très utilisés, Motus, FastWAM et LingBotVA, sur le benchmark RoboTwin 2.0. Le nombre moyen d'étapes de débruitage baisse de 60,2 %, 49,8 % et 85,28 % respectivement, à taux de réussite inchangé. À budget d'une seule étape, l'entraînement AnyStep améliore le taux de succès de 7,07, 12,08 et 8,94 points ou pourcentages (l'article ne précise pas) selon le modèle. Six tâches de manipulation réelles viennent compléter l'évaluation.
L'enjeu est la latence de décision, un des freins à l'utilisation de modèles génératifs sur des robots réels. Le débruitage à coût constant gaspille du calcul sur les gestes faciles, comme l'approche ou le transport, alors que seuls les gestes critiques (insertion, saisie fine) exigent de la précision. Allouer le calcul selon la scène rapproche les WAM de fréquences de contrôle compatibles avec des cadences industrielles, sans changer de modèle de base. Le fait que la méthode s'applique à trois architectures distinctes suggère une approche générique plutôt qu'un réglage sur mesure, ce qui intéresse les intégrateurs qui comparent coûts d'inférence et embarqué. Il faut toutefois rester prudent : les gains les plus nets sont mesurés en simulation, sur RoboTwin 2.0. Les six tâches réelles ne sont pas détaillées dans le résumé, et aucun temps de cycle ni gain de latence en millisecondes n'est donné, seulement des réductions d'étapes. La réduction d'étapes ne se traduit pas mécaniquement en gain de temps mesuré sur matériel.
Ce travail s'inscrit dans une série de recherches qui cherchent à accélérer les politiques génératives, après les flow maps, la distillation en une étape et les modèles consistency. Les WAM, qui apprennent à prédire l'évolution visuelle du monde avec les actions, se placent en alternative aux VLA (vision-language-action) comme Pi-0 ou GR00T, au prix d'un calcul plus lourd. C'est ce surcoût que AnyStep-WAM vise à réduire. Il s'agit d'un preprint arXiv (version 2 du 2609.33748), sans relecture par les pairs ni déploiement industriel annoncé. La suite logique serait une validation sur plus de tâches réelles, avec mesure de la latence de bout en bout et de la robustesse hors distribution.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




