LeWAM : un modèle d'action du monde JEPA avec MPC guidé par pilotage de diffusion
LeWAM, présenté sur arXiv (2610.12407v1), est un « world action model » (WAM) : un transformeur bidirectionnel qui gère quatre modes dans un même réseau, à savoir la dynamique directe, la dynamique inverse, la dynamique arrière et la prédiction de politique. Le modèle s'appuie sur un espace latent de type JEPA sans décodeur, entraîné de bout en bout à travers ces quatre modes. Les auteurs revendiquent trois résultats. D'abord, des sondes linéaires lisent l'état du robot et des objets dans le latent de LeWAM mieux que dans celui de LeWM (Le World Model, un JEPA à dynamique directe seule), tandis que le latent ignore les distracteurs visuels aussi bien que LeWM et bien mieux qu'un WAM fondé sur la reconstruction. Ensuite, en boucle fermée, LeWAM égale une politique classique à flow matching entraînée sur le même encodeur à taille équivalente, tout en fournissant en plus un modèle du monde. Enfin, pour la planification, échantillonner des actions brutes dans un MPC laisse le planificateur exploiter les erreurs du modèle de dynamique. Planifier dans l'espace de bruit de la tête de politique, une approche de « diffusion steering », améliore les performances en boucle fermée.
Pour les équipes qui conçoivent des politiques robotiques, le résultat le plus utile est sans doute le troisième. Le MPC avec modèle appris a un défaut connu : l'optimiseur cherche les actions qui font mentir le modèle, et non celles qui réussissent la tâche. Contraindre la recherche au voisinage de ce que la politique sait produire limite ce biais, sans exiger un modèle du monde parfait. Le deuxième résultat compte aussi : unifier politique et modèle du monde ne dégrade pas le contrôle, ce qui évite de maintenir deux réseaux. L'argument de fond est que des représentations prédictives, sans reconstruction de pixels, se montrent plus robustes aux distracteurs visuels, un point critique en environnement d'atelier ou d'entrepôt, où l'éclairage et l'arrière-plan varient. Il faut toutefois rester prudent. Le résumé ne donne ni chiffres de succès, ni noms de benchmarks, ni nombre de tâches, ni indication de test sur robot réel. On ignore donc l'ampleur des gains et leur transfert hors simulation.
Ce travail prolonge deux courants : les architectures JEPA, portées par l'école de Yann LeCun autour de l'apprentissage de représentations prédictives, et les world action models qui prédisent conjointement actions et observations futures, généralement à partir de latents reconstructifs, souvent issus de modèles de vidéo ou de diffusion. LeWAM se positionne en alternative plus légère et plus alignée avec l'état physique. Il se compare à LeWM, sa base directe, et aux WAMs à reconstruction, plutôt qu'à des VLA de grande échelle comme Pi-0 ou GR00T. Il s'agit d'un preprint v1, sans relecture par les pairs. Les prochaines étapes à surveiller sont la publication des chiffres détaillés, les tests sur matériel réel et le passage à l'échelle avec des données multi-tâches.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




