DeltaWAM : modèles delta monde-action pour la manipulation bimanuelle
Des chercheurs du AIGeeksGroup publient DeltaWAM (Delta World Action Models), une nouvelle architecture pour piloter des bras robotiques bimanuels via l'apprentissage vidéo, détaillée dans un article arXiv (2609.28811v1) diffusé fin septembre 2026, avec code et démonstrations disponibles sur GitHub. Les modèles World-Action (WAM) classiques transfèrent les connaissances visuelles et de mouvement de générateurs vidéo préentraînés vers le contrôle robotique, mais ils prédisent à chaque étape des images futures complètes, ce qui recalcule inutilement du contenu inchangé et ralentit la génération d'actions en temps réel. DeltaWAM sépare le flux en trois composantes, une ancre dense, un delta visuel épars et un flux d'actions, déclinées en trois architectures selon le partage de calcul et de représentation. Le système ajoute une Streaming Delta Memory (SDM) qui met à jour un contexte d'ancrage en cache à partir des seuls changements observés, évitant de repasser par le lourd module vidéo à chaque pas. Sur le benchmark RoboTwin, DeltaWAM avec SDM porte le taux de réussite moyen de 81,3% à 85,4% en conditions standard, et de 75,8% à 83,9% avec randomisation visuelle, par rapport à la référence Fast-WAM. Les trois architectures réduisent le coût de calcul à l'entraînement de 17,78 à 23,77%, tandis que la SDM abaisse la latence d'inférence de 36,57% et le calcul associé de 31,55%.
Pour l'industrie robotique, ce travail cible un goulot d'étranglement concret: les modèles génératifs vidéo, puissants pour transférer des priors de mouvement, restent trop lourds pour du contrôle en quelques pas de temps, un frein direct pour des manipulations bimanuelles réactives en usine ou en logistique. En découplant la dynamique liée à l'action des variations d'apparence parasites, DeltaWAM répond à un doute récurrent sur les architectures VLA à grande échelle: leur capacité à généraliser sans reconstruire l'intégralité de la scène à chaque inférence. Les gains annoncés en conditions réelles restent toutefois évalués par les auteurs eux-mêmes, face à un nombre limité de politiques concurrentes, sans validation indépendante à ce stade.
L'article s'inscrit dans la lignée des WAM apparus pour exploiter les générateurs vidéo comme source de priors physiques, avec Fast-WAM comme point de comparaison direct explicitement cité. Aucun acteur industriel ni équipe européenne n'est mentionné, le travail restant à ce stade une contribution académique avec code ouvert, sans annonce de déploiement matériel ni de partenariat commercial.
Dans nos dossiers




