Politique en escalier : inférence en flux continu pour les modèles monde-action à grands blocs d'actions
Des chercheurs proposent Staircase Policy, un cadre d'inférence et d'entraînement en flux continu (streaming) qui transforme une politique VLA (vision-langage-action) à flow matching en un « World-Action Model » (WAM) de type JEPA. L'article, publié sur arXiv (2609.36471v1), découpe un grand bloc d'actions (action chunk) en sous-blocs placés à des stades de débruitage décalés. Les actions les plus proches sont exécutées dès qu'elles sont disponibles, pendant que les suivantes continuent d'être affinées. À chaque frontière de sous-bloc, l'état latent futur est re-prédit à partir de la dernière observation et sert à mettre à jour toutes les actions non exécutées, sans relancer une inférence complète. Le modèle, nommé S-WAM, atteint 97,7 % sur LIBERO et 87,9 % sur LIBERO-Plus. Il produit 292,7 actions exécutées par seconde, soit 3,62 fois le débit d'une exécution conventionnelle à précision comparable, et ramène le délai avant la première action de 123,6 à 73,3 ms. Avec des optimisations d'inférence supplémentaires, le débit monte à 642,9 actions par seconde. Les auteurs revendiquent aussi des gains sur plusieurs architectures de politiques et sur des tâches en robot réel, sans que le résumé en précise le nombre, la nature ni les taux de réussite.
L'enjeu est d'abord économique. Les WAM, qui conditionnent la génération d'actions sur des observations futures prédites, améliorent la manipulation, mais ajoutent un coût de calcul à une génération d'actions déjà itérative et coûteuse. L'action chunking amortit ce coût, au prix d'une dégradation sur les longs horizons, car les dernières actions du bloc reposent sur des observations périmées. Staircase Policy vise à lever ce compromis entre latence et réactivité, ce qui compte pour les intégrateurs qui veulent embarquer de gros modèles sur des robots à budget de calcul limité. L'erreur de prédiction du futur peut en outre servir de signal pour un chunking adaptatif, c'est-à-dire une confiance mesurable dans le plan en cours. Ces résultats restent toutefois des benchmarks en simulation. LIBERO est proche de la saturation, et un débit en actions par seconde ne dit rien de la robustesse en production. Les mesures en robot réel devront être détaillées pour juger du transfert.
Ce travail s'inscrit dans la montée des modèles fondations de robotique fondés sur des VLA à flow matching, dans la lignée de Pi-0, et dans l'intérêt croissant pour les architectures prédictives de type JEPA, qui prédisent dans un espace latent plutôt qu'en pixels. Les WAM concurrencent les VLA purs en injectant une anticipation du monde, mais leur latence freine leur déploiement. D'autres approches d'exécution asynchrone ou de chunking en temps réel traitent le même problème, sans forcément coupler prédiction du futur et débruitage échelonné. La suite dépendra de la publication du code, de validations indépendantes et de tests sur des plateformes industrielles, aucun pilote n'étant annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




