DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde
Une équipe de recherche publie DIDO (arXiv 2609.15570, septembre 2026), une méthode de distillation pour les World Action Models (WAM), ces systèmes qui utilisent des modèles de génération vidéo pour prédire la dynamique visuelle future et piloter la manipulation robotique. Le problème de départ est la latence : le débruitage itératif de ces modèles vidéo est incompatible avec un contrôle en boucle fermée. Les auteurs montrent empiriquement que le contenu visuel converge à des vitesses différentes durant le débruitage : le fond statique de la scène se forme dès les premières étapes, tandis que la pince du robot et l'objet manipulé restent flous, leur dynamique d'interaction n'émergeant que lors des étapes suivantes. Tronquer naïvement un modèle multi-étapes à une seule étape préserve donc la structure de la scène mais perd l'information d'interaction, la plus critique pour la manipulation. DIDO combine une distillation par appariement de distribution avec un guidage centré sur l'interaction : des tokens de raisonnement visuel supervisés par boîtes englobantes modélisent la pince, l'objet et leur interaction, et les représentations de l'objet cible sont alignées, sur plusieurs couches, avec les caractéristiques d'un encodeur DINOv3 préentraîné. Résultat : 99,0% de réussite sur LIBERO, 76,6% sur LIBERO-Plus et 92,0% sur RoboTwin, en une seule étape de débruitage.
Pour les intégrateurs et chercheurs en robotique, l'enjeu est concret : les modèles vidéo-génératifs produisent des prédictions visuelles de qualité, mais leur coût de calcul itératif les rend souvent inadaptés au temps réel. En ramenant le débruitage à une seule étape sans sacrifier la dynamique gripper-objet, DIDO s'attaque à un des obstacles qui séparent les démonstrations de manipulation en simulation d'un déploiement réactif. Le travail met aussi en garde contre la distillation naïve des WAM : réduire le nombre d'étapes sans traitement spécifique dégrade précisément l'information la plus utile à la tâche.
DIDO s'inscrit dans la lignée des World Action Models, qui détournent des générateurs vidéo pour servir de moteur de prédiction à des politiques de manipulation, en s'appuyant sur des encodeurs visuels auto-supervisés comme DINOv3 de Meta, utilisé ici comme signal d'enseignement. Les résultats restent validés sur des benchmarks de simulation standards du secteur (LIBERO, LIBERO-Plus, RoboTwin), complétés par des essais réels sur des tâches longues et des scénarios de généralisation. Aucun partenariat industriel ni date de disponibilité n'est mentionné : il s'agit à ce stade d'une publication de recherche, pas d'un produit livré.
Dans nos dossiers




