
Long-WAM : étendre le contexte des modèles monde-action
Des chercheurs publient Long-WAM, un cadre modèle-système conçu pour étendre le contexte visuel des world-action models (WAM) causaux, ces architectures qui prédisent à la fois les futures images et les actions d'un robot. Le travail, déposé sur arXiv, repose sur un constat central : disposer d'un historique n'implique pas de s'en servir. Les historiques longs ne rapportent beaucoup que si le modèle vidéo de base a été préentraîné de façon autorégressive (AR). Les auteurs apprennent d'abord la prédiction causale sur des vidéos de robots et des vidéos égocentriques sans étiquettes d'action, puis préservent cette structure historique-futur lors de l'adaptation aux actions. Sur RoboCasa GR-1, passer de 0,0 à 19,2 secondes de contexte fait grimper le taux de succès de 63,3 % à 78,7 %. Une initialisation préentraînée de manière bidirectionnelle n'en tire aucun gain net. Long-WAM affiche aussi les meilleurs résultats parmi les méthodes comparées sur LIBERO-Long, RoboTwin 2.0 et DOMINO.
L'intérêt tient à deux points. D'abord, le résultat contredit l'idée répandue qu'il suffit d'allonger la fenêtre de contexte pour obtenir de la mémoire utile : le mode de préentraînement vidéo pèse davantage que la longueur brute de l'historique. Ensuite, la contrainte temps réel est traitée de front. L'encodage des observations en flux continu, l'exécution asynchrone et l'accélération spécifique à chaque matériel permettent un déploiement sur RTX 5090, DGX Spark et Jetson AGX Thor, sans supprimer la prédiction du futur. Sur RTX 5090, chaque bloc d'actions, prédiction du latent vidéo futur comprise, demande 107,4 ms. Sur robots réels, Unitree G1 et YAM, le système gère des tâches dynamiques et à long horizon. Il atteint 95 % de réussite à l'empilement dynamique de gobelets, là où Pi0.5 et Fast-WAM échouent sur les 20 essais. Ces chiffres viennent des auteurs, sur un jeu de 20 essais et une tâche choisie par eux. Ils méritent donc une réplication indépendante avant d'être généralisés.
Ce travail s'inscrit dans la montée des WAM, qui concurrencent les politiques vision-langage-action (VLA) comme Pi0.5 en exploitant la vidéo comme signal d'apprentissage dense. Fast-WAM, l'autre référence directe de l'article, cherchait déjà à rendre ces modèles assez rapides pour le contrôle. Long-WAM ajoute la mémoire à cette équation, avec des benchmarks surtout simulés, et le pilotage de robots d'Unitree et de YAM, plateformes accessibles aux laboratoires. Les auteurs indiquent que le modèle sert aussi d'exécuteur doté de mémoire, complémentaire d'une planification de plus haut niveau dans des tâches composites. Il s'agit d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra de la publication éventuelle du code et des poids, et de la tenue des résultats hors des tâches de démonstration.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




