Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone
Un modèle de recherche baptisé Streaming-WAM (World-Action Model), décrit dans un article publié sur arXiv le 25 septembre 2026 (arXiv:2609.28927v1), s'attaque au coût de calcul des modèles qui prédisent l'image future pour piloter un bras robotique. Ces modèles, dits world-action models, génèrent habituellement une prédiction visuelle avant de produire l'action suivante, ce qui immobilise le robot pendant l'inférence. Streaming-WAM fonctionne en mode asynchrone : à chaque mise à jour, il conditionne sa prédiction visuelle non seulement sur la dernière observation caméra, mais aussi sur les actions déjà engagées, c'est-à-dire le segment fixe du prochain lot de mouvements en cours d'exécution par le robot. Les caractéristiques visuelles ainsi anticipées servent ensuite à générer, dans la même passe, les actions restantes du lot. Sur le benchmark de simulation LIBERO, le système atteint un taux de succès moyen de 98,35 % tout en divisant par 2,93 le temps moyen par épisode par rapport à une variante appelée Fast-WAM. Sur une tâche en conditions réelles consistant à tamponner une feuille de papier, le temps d'épisode passe de 90 secondes avec un modèle synchrone classique (Joint-WAM) à 38 secondes avec Streaming-WAM.
L'enjeu dépasse la simple accélération : les world-action models sont perçus comme un moyen de rendre la manipulation robotique plus robuste en anticipant les conséquences visuelles d'une action avant de l'exécuter, mais leur latence de génération les rendait jusqu'ici difficiles à déployer en temps réel. En montrant qu'il est possible de conserver un taux de succès élevé tout en réduisant fortement le temps de cycle grâce à l'asynchronie, ce travail répond directement à l'un des reproches récurrents faits aux architectures de prédiction du monde en robotique : leur écart entre performance en simulation et viabilité pratique. Pour les intégrateurs et laboratoires qui évaluent ces approches face aux politiques vision-langage-action plus légères, ce type de résultat suggère qu'il n'est plus nécessaire de sacrifier la vitesse pour garder les bénéfices de la prédiction visuelle.
Le travail se positionne comme une amélioration incrémentale par rapport à deux approches de référence citées dans l'article, Fast-WAM et Joint-WAM, qui servent de points de comparaison directs plutôt que de produits commerciaux. Il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé sur un seul benchmark simulé et une unique tâche physique réalisée en laboratoire, sans indication de partenariat industriel, de déploiement en usine ni de calendrier de commercialisation. La prochaine étape logique, non détaillée dans l'article, consisterait à étendre l'évaluation à un éventail plus large de tâches manuelles réelles et à des plateformes robotiques variées.
Dans nos dossiers




