JEPA-WAM : relier instructions visuelles générées aux modèles d'action du monde via les représentations latentes JEPA
Des chercheurs ont publié sur arXiv (2609.20277v1) JEPA-WAM, un système qui améliore les World Action Models (WAM), ces architectures de manipulation robotique combinant modèles génératifs vidéo pré-entraînés et experts d'action. Le constat de départ : les WAM actuels suivent mal les instructions textuelles seules, car les données d'apprentissage associent des trajectoires riches à des annotations linguistiques pauvres et répétitives, ce qui pousse les modèles à reconnaître la tâche par le contexte visuel plutôt que par l'instruction elle-même. JEPA-WAM génère pour chaque instruction une banque d'images de "tâche accomplie" via un générateur texte-image du commerce non ré-entraîné, encodées par un modèle V-JEPA 2.1 figé puis compressées en tokens d'objectif qui conditionnent, par cross-attention, les experts vidéo et action. Sur un benchmark robotique réel couvrant des cas en distribution, des scènes hors distribution et des instructions hors distribution, JEPA-WAM atteint 87,3%, 74,5% et 80,9% de réussite, dépassant Pi-0 et Fast-WAM d'au moins 10, 27,3 et 14,5 points selon les cas.
Ce travail cible un point de friction central des modèles vision-langage-action : la capacité à réellement comprendre une instruction plutôt qu'à reconnaître une tâche par des raccourcis visuels appris à l'entraînement, biais fréquent quand les données combinent peu de variété linguistique et beaucoup de répétition. Pour les équipes qui déploient des bras manipulateurs en logistique ou en usine, un robot capable de généraliser à des scènes ou formulations inédites demande moins de reprogrammation et de données spécifiques par tâche. L'écart entre le taux en distribution (87,3%) et les taux hors distribution (74,5% et 80,9%) montre toutefois que la généralisation reste un problème réel, même si JEPA-WAM le réduit nettement face aux références testées.
La méthode s'inscrit dans la lignée des WAM, qui augmentent des générateurs vidéo pré-entraînés avec des têtes d'action pour piloter des robots, approche déjà incarnée dans l'écosystème vision-langage-action par des modèles comme Pi-0. JEPA-WAM se positionne explicitement face à Pi-0 et Fast-WAM comme références sur son propre benchmark. Il s'agit à ce stade d'une publication de recherche en preprint sur arXiv, sans nom d'entreprise, de produit commercial ni de déploiement industriel associé : aucun calendrier de mise en œuvre n'est communiqué, et la méthode reste à valider par la communauté et sur des plateformes robotiques plus variées.
Dans nos dossiers




