
RealtimeWAM : à quelle vitesse peut tourner mon modèle d'action du monde ?
Des chercheurs proposent RealtimeWAM, un cadre d'inférence qui ne nécessite aucun réentraînement et vise à réduire la latence des World Action Models (WAM), ces modèles qui associent modélisation de la dynamique visuelle et génération d'actions pour piloter un robot. Le travail, publié sur arXiv (2610.10079), part d'un constat : la latence d'inférence des WAM limite la réactivité du contrôle en boucle fermée. Les auteurs combinent l'exécution parallèle, en exploitant les dépendances entre couches pour recouvrir le traitement de l'observation et la prédiction, avec une réutilisation sélective du calcul. Celle-ci consiste à mettre en cache les caractéristiques d'observation dans les zones visuellement stables et à réutiliser les résidus des Transformers, tout en réservant un raffinement supplémentaire aux cas où les ajustements d'action prédits sont faibles. Testé sur FastWAM et OpenWAM, avec les benchmarks RoboTwin, LIBERO et LIBERO-Plus, sur un GPU RTX 4090, le système affiche des latences moyennes de 24,09 ms et 63,09 ms, soit des accélérations moyennes de 8,90 fois et 10,67 fois. Les taux de réussite moyens atteignent 82,75 % et 87,41 %, à 0,02 et 0,53 point de pourcentage de l'inférence native. Sur cinq tâches réelles, le gain de réussite par rapport à l'inférence native est de 17,2 points pour FastWAM et de 37,2 points pour OpenWAM.
L'intérêt tient à la généralité de l'approche. Les WAM sont attractifs parce qu'ils intègrent une représentation de la dynamique du monde à la politique, mais leur coût de calcul les rend difficiles à déployer sur du matériel accessible. Passer à 24 ms sur un GPU grand public de 2022 rend envisageable une fréquence de contrôle compatible avec une boucle fermée, là où la latence native pénalise la réactivité. Le gain en conditions réelles est le résultat le plus parlant : une partie de l'écart entre simulation et terrain semble venir du retard d'inférence plus que de la qualité du modèle, puisque la politique réagit mieux quand elle décide plus vite. À nuancer toutefois : il s'agit d'un preprint non évalué par les pairs, les cinq tâches réelles sont peu nombreuses, les gains les plus forts viennent d'OpenWAM, le plus lent au départ, et les auteurs ne précisent pas dans ce résumé les plateformes robotiques ni le nombre d'essais. Les métriques de latence sont mesurées sur un seul GPU, sans indication sur les plateformes embarquées.
Ce travail s'inscrit dans l'effort d'accélération des WAM. FastWAM a réduit la latence en supprimant la génération explicite de vidéo future au moment du test, mais au prix d'une architecture spécialement conçue. Les stratégies de cache plus générales exploitent la redondance des caractéristiques, sans tenir compte de l'évolution des besoins de calcul en contrôle en boucle fermée. RealtimeWAM se positionne entre les deux, comme couche applicable à diverses architectures, et le fait qu'il améliore FastWAM, déjà optimisé, suggère que les deux approches sont complémentaires. Les prochaines étapes naturelles seraient des tests sur davantage de WAM, sur des GPU embarqués de type Jetson et sur des tâches plus longues et plus variées, ainsi qu'une publication du code permettant de reproduire les résultats.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




