Modélisation du monde et des actions avec planification visuelle progressive
Des chercheurs présentent ProWAM, un « world action model » (WAM) progressif qui prédit conjointement des actions robotiques et une séquence ordonnée de sous-objectifs visuels épars, à partir d'une observation initiale et d'une instruction. Les WAM existants butent sur les tâches longues : générer des vidéos denses est coûteux, et les variantes qui ne prédisent qu'une seule image future ne disent pas comment progresser vers le but. ProWAM exécute une seule passe avant du backbone vidéo pour mettre en cache les caractéristiques de ces sous-objectifs, puis n'effectue qu'un débruitage d'actions léger à chaque replanification. Les résultats annoncés en simulation sont 85,8 % sur LIBERO-Plus et 75,7 % sur RoboTwin randomisé, soit jusqu'à +35,9 % en relatif face à la meilleure référence. Sur RoboCasa365, le modèle atteint 48,1 % de réussite globale (4e rang) et 18,2 % sur le split difficile Composite-Unseen. En conditions réelles, en zéro-shot dans des scènes inédites, il obtient 70,0 % de réussite contre 55,0 % pour la meilleure référence, soit +15 points (+27,3 % en relatif).
L'intérêt tient à la manière dont le modèle sépare planification visuelle et contrôle. Comme la prédiction de sous-objectifs peut s'apprendre sur de grands volumes de vidéos sans actions annotées, le backbone vidéo absorbe la planification que la politique d'action n'a plus à apprendre seule. Cela exploite des données bien plus abondantes que les démonstrations téléopérées. Le coût d'inférence est aussi un enjeu concret : éviter la génération itérative de vidéo complète rend la replanification en boucle fermée plus réaliste sur du matériel embarqué. Le gain porte surtout sur la robustesse hors distribution, point faible classique des politiques VLA et WAM, ce qui touche directement l'écart entre démonstration et déploiement. Quelques réserves : le test réel repose sur un échantillon qui semble réduit (les pourcentages sont des multiples de 5 points, ce qui suggère une vingtaine d'essais), l'écart de 15 points est donc statistiquement fragile. Le classement 4e sur RoboCasa365 nuance aussi une domination qui n'est établie que sur certains benchmarks. Il s'agit en outre d'un préprint arXiv (2610.02508v1), non évalué par les pairs, sans produit ni déploiement industriel associé.
Ce travail s'inscrit dans la montée des modèles du monde appliqués au contrôle, qui cherchent à dépasser les VLA purement réactifs en ajoutant une anticipation visuelle. Les approches denses, qui génèrent des vidéos complètes, pèsent lourd en calcul, tandis que les approches à image future unique manquent de guidage intermédiaire. ProWAM se place entre les deux, avec une anticipation indexée sur la progression de la tâche. Le projet est hébergé sous le nom d'organisation « sii-ferenas » ; le résumé ne précise ni le code ni les poids publiés, ni la comparaison détaillée avec des modèles comme Pi-0 ou GR00T. La suite logique serait une validation sur davantage de tâches réelles, avec des essais plus nombreux, et des mesures de latence sur robot pour confirmer le gain d'efficacité revendiqué.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




