DynamicWAM : conditionnement de mouvement à double voie pour les modèles monde-action en manipulation dynamique
Des chercheurs ont publié le 1er août 2026 sur arXiv (référence 2608.00793v1) un modèle baptisé DynamicWAM, conçu pour la manipulation d'objets en mouvement, un cas que les World-Action Models (WAM) actuels gèrent mal puisqu'ils ne se basent que sur l'image courante. L'architecture combine deux canaux complémentaires : un flux d'historique optique, qui encode des trames de flux optique alignées temporellement avec l'observation courante via un VAE vidéo pré-entraîné et figé, pour préserver la structure spatiale du mouvement, et un canal de descripteurs cinématiques (déplacement, durée, vitesse, accélération) injectés directement dans l'expert d'action pour fournir l'amplitude et le timing du mouvement. Les deux flux sont fusionnés par une attention conjointe monde-action, associée à un backbone compact distillé et à une exécution asynchrone basée sur le chunking temps réel (RTC). Sur le benchmark DOMINO, DynamicWAM atteint 38,2 % de taux de réussite et un score de manipulation de 53,2, devançant toutes les bases de comparaison testées. Sur 12 tâches réelles couvrant des mouvements linéaires, circulaires et composés, le taux de réussite moyen grimpe à 46,7 %, soit 22,9 points de pourcentage de plus que la meilleure base de référence.
Ce résultat cible un angle mort réel des WAM et des modèles vision-langage-action (VLA) actuels : la plupart de ces systèmes fonctionnent bien sur du pick-and-place statique mais peinent dès que la cible bouge, un scénario pourtant courant en logistique (convoyeurs) ou en collaboration humain-robot. En montrant qu'un backbone compact avec exécution asynchrone bat des bases plus lourdes en synchrone, l'étude appuie l'idée que la réactivité temps réel, plus que la seule taille du modèle, conditionne la robustesse en manipulation dynamique.
Le travail s'inscrit dans la lignée des WAM qui combinent modèle du monde (prédiction vidéo) et modèle d'action, dans la continuité de familles comme Pi-0 ou GR00T, mais en ciblant spécifiquement les cibles mobiles plutôt que les scènes figées. Il s'agit d'un préprint non encore relu par les pairs, avec une validation réelle limitée à 12 tâches ; une extension à des benchmarks plus larges et des scénarios industriels plus complexes reste à démontrer.
Dans nos dossiers




