
Zero-WAM : modélisation monde-action en contexte à partir de vidéos humaines pour la généralisation de tâches ouvertes
Des chercheurs présentent Zero-WAM, un modèle causal vidéo-action qui exécute des tâches de manipulation robotique inédites en suivant une simple vidéo humaine donnée en contexte, sans réentraînement, sur le principe de l'apprentissage en contexte des grands modèles de langage. Pour pallier le manque de données appariées humain-robot, ils ont construit un pipeline automatique générant HumanGen, 74 200 paires vidéo sur 8 600 tâches, avec un nouvel objectif d'entraînement dit IFP (prédiction de segments futurs en contexte). Sur sept tâches inédites du simulateur RoboTwin 2.0, le modèle atteint 47,0% de réussite, soit +29,5 points face à la meilleure base vidéo-action comparée, et des essais réels montrent une généralisation à des scènes multi-objets et à des insertions fines. L'article, publié sur arXiv (2608.26103), reste une contribution académique sans produit ni partenaire industriel annoncé.
L'enjeu dépasse la performance brute : la plupart des modèles vision-langage-action doivent être réentraînés ou finement ajustés pour chaque nouvelle tâche, ce qui alourdit les coûts d'intégration industrielle. En montrant qu'une vidéo de démonstration peut servir de consigne à la volée, Zero-WAM propose une alternative au conditionnement par le langage utilisé par des approches comme Pi-0 ou GR00T N2, et suggère une piste pour réduire la dépendance aux collectes de démonstrations spécifiques par tâche. Le résultat mérite toutefois d'être nuancé : un taux de réussite de 47% reste modeste en absolu, et l'essentiel de la validation chiffrée se fait en simulation, les essais réels n'étant pas quantifiés dans l'abstract.
L'apprentissage en contexte, popularisé par les grands modèles de langage généralistes, se heurtait en robotique à la rareté de vidéos humaines et robotiques appariées, problème que ce travail attaque via son pipeline HumanGen. Il se positionne face à l'écosystème des modèles vision-langage-action généralistes tels Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui misent davantage sur le langage que sur la vidéo comme consigne. Aucun acteur français ou européen n'apparaît dans cette publication, et les auteurs ne fournissent ni pilote industriel ni feuille de route de commercialisation.
Dans nos dossiers




