GlanceWAM : imagination parcimonieuse au moment du test pour les modèles monde-action
Des chercheurs publient sur arXiv GlanceWAM, une architecture de « world-action model » (WAM) qui sépare l'imagination visuelle du contrôle moteur sur un unique backbone vidéo de type DiT (Diffusion Transformer) partagé. Un module « proposeur » asynchrone tourne sur une horloge lente et génère en arrière-plan une seule image d'anticipation, projetée à quelques secondes dans le futur. En parallèle, une tête d'action décode des « chunks » d'actions au rythme du contrôle, soit 48 ms par chunk sur un seul GPU A100, entièrement dans l'espace latent et sans attendre la génération vidéo. Deux mécanismes rendent cela possible : un masque d'attention « non interférant » qui isole les représentations vidéo de celles de l'action, et un entraînement robuste à la péremption, qui prépare le modèle à exploiter une anticipation devenue légèrement ancienne. Entraîné uniquement sur démonstrations, le modèle atteint 72,2 % de réussite sur le benchmark RoboCasa (24 tâches de cuisine), contre 67,1 % pour Cosmos Policy en mode synchrone, et 99,0 % sur LIBERO. La latence par chunk est divisée par 24 par rapport aux WAM synchrones. En manipulation réelle, mono-bras et bimanuelle, il dépasse en moyenne π0.5 sans aucun pré-entraînement sur données robot. Le code est publié sur GitHub.
L'enjeu est un compromis que les WAM n'avaient pas résolu. Générer de la vidéo à la fréquence de contrôle est trop lent pour un robot réel, alors que supprimer l'imagination au moment de l'inférence coûte en taux de réussite. Ici, les deux gains arrivent ensemble : l'anticipation sert de signal de guidage sans se trouver sur le chemin critique. Pour un intégrateur, cela rend plausible l'usage de priors issus de modèles vidéo sur du matériel standard, sans grappe de GPU dédiée au contrôle. Le résultat contredit aussi l'idée que la prédiction visuelle fine, image par image, serait nécessaire : une seule image future, consommée en latent, suffit. Quelques réserves s'imposent toutefois. Les chiffres viennent de benchmarks de simulation, où l'écart de 5 points avec Cosmos Policy reste modeste, et LIBERO est quasi saturé. Les essais réels, dont la taille n'est pas précisée dans le résumé, n'ont pas été validés indépendamment. Il s'agit d'un travail académique, pas d'un produit déployé.
Ce travail s'inscrit dans la montée des modèles monde-action, qui réutilisent les modèles de génération vidéo pour doter les politiques robotiques d'une intuition physique. Cosmos Policy, de NVIDIA, en est la référence synchrone, et π0.5, de Physical Intelligence, représente la famille des VLA (vision-language-action) entraînés à grande échelle sur données robot. Le fait de battre π0.5 sans pré-entraînement robot suggère que les modèles vidéo pré-entraînés peuvent compenser en partie le manque de données de manipulation, un point sensible alors que ces corpus restent coûteux. La suite logique est de valider l'approche sur des tâches plus longues et sur d'autres plateformes, notamment les humanoïdes. Le code ouvert devrait permettre à d'autres équipes de reproduire et de contester ces résultats rapidement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



