
DualWAM : modèles monde-action à double système pour la planification globale asynchrone et le raffinement local
DualWAM (Dual-System World Action Models) associe génération d'actions robotiques et prédiction de l'état futur du monde à partir de priors appris par pré-entraînement vidéo, en séparant un module de planification globale et un module de raffinement local. Le premier effectue périodiquement un débruitage bidirectionnel à fort bruit sur un segment d'action étendu ; le second, dédié au poignet, affine ce plan en continu à partir des observations visuelles les plus récentes du point de contact, qui renseignent sur la géométrie locale et le moment du contact. Testée en zero-shot sur des tâches de manipulation avec les robots Franka et Galbot, l'architecture améliore le taux de succès de 4,5 points de pourcentage en moyenne face à la meilleure référence évaluée, avec un temps de chemin critique divisé par 16,6. Des données égocentriques et UMI adaptées au rôle de chaque module ajoutent par ailleurs 14 points de succès, selon le papier arXiv:2609.24868v1, publié en septembre 2026.
L'enjeu visé touche un point sensible des modèles vision-langage-action (VLA) : prédire les images futures coûte cher en calcul, ce qui pousse la plupart des architectures existantes à utiliser de longs segments d'action pour amortir ce coût, au prix de la réactivité en boucle fermée. En séparant planification à long horizon et correction haute fréquence, DualWAM répond à ce compromis sans sacrifier ni la portée du plan ni la vitesse nécessaire lors du contact fin. Pour les intégrateurs industriels, l'architecture ouvre aussi une piste de déploiement en edge-cloud, le plan global, plus lourd, pouvant tourner dans le cloud pendant que le raffinement reste embarqué, avec une bande passante nécessaire nettement réduite. Les gains restent toutefois mesurés en zero-shot sur un nombre limité de tâches et seulement deux plateformes, ce qui invite à la prudence avant toute extrapolation à une mise en production à grande échelle.
Les World Action Models prolongent la lignée des modèles VLA qui transfèrent des priors appris sur vidéo vers le contrôle robotique, une approche qui a gagné du terrain face aux limites des politiques entraînées uniquement sur des démonstrations robotiques. Le compromis entre horizon de prédiction et fréquence de contrôle que cible ce travail est un problème connu du secteur, habituellement contourné en allongeant les segments d'action au détriment de la réactivité. Le résumé du papier ne nomme aucun système concurrent précis, se limitant à une comparaison avec la "meilleure référence évaluée", ce qui empêche de le positionner clairement face aux modèles VLA commerciaux ou aux travaux académiques récents du secteur. Aucun partenaire industriel, pilote ou calendrier de déploiement n'est mentionné : il s'agit pour l'instant d'une contribution de recherche publiée sur arXiv, sans indication de mise en production.
Dans nos dossiers




