Aller au contenu principal
JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint
RecherchearXiv cs.RO 

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

JEPA-WAM, un nouveau modèle de monde latent (world action model, WAM) pour le contrôle robotique, est présenté dans un article publié le 11 août 2026 sur arXiv (2608.09381v1). Le système s'appuie sur l'espace latent pré-entraîné V-JEPA, l'architecture d'auto-supervision vidéo développée par Meta AI, et couple prédiction de transition et génération d'action continue via un prédicteur partagé, plutôt que de générer explicitement des vidéos futures comme le font les WAM à base vidéo, coûteux à déployer. Sur le benchmark LIBERO-Plus, JEPA-WAM atteint 79,2 % de réussite, le meilleur score parmi les méthodes sans pré-entraînement à grande échelle sur des politiques robotiques. Instancié sur le modèle pi_0.5 déjà pré-entraîné, il grimpe à 86,3 %, la meilleure performance globale rapportée dans l'article. Des expériences complémentaires sur le simulateur RoboTwin 2.0 et sur des tâches de manipulation bimanuelle en conditions réelles confirment une bonne généralisation face aux variations visuelles et spatiales.

Ce travail s'attaque à un compromis central dans l'apprentissage de politiques vision-langage-action (VLA) : les modèles de monde générant explicitement des vidéos futures sont coûteux en calcul et en latence, tandis que les approches latentes existantes sacrifient souvent la richesse de la représentation prédictive ou la séparent du chemin utilisé pour générer l'action. En démontrant qu'un même prédicteur partagé peut porter à la fois la supervision de transition et la prédiction d'action sans déconnecter représentation et politique, JEPA-WAM fournit un argument empirique en faveur de l'unification des deux tâches dans une même colonne vertébrale visuelle. Pour les équipes de recherche et les intégrateurs en robotique, l'intérêt pratique tient au fait que la méthode s'applique aussi à des politiques VLA déjà pré-entraînées, comme pi_0.5, sans modifier leurs chemins de perception et d'action d'origine, ce qui laisse entrevoir un gain applicable à des systèmes existants plutôt qu'une architecture entièrement nouvelle à réentraîner.

Il s'agit d'un article de recherche publié sur arXiv, sans annonce de produit ni de déploiement commercial : les résultats reposent sur des benchmarks de simulation (LIBERO-Plus, RoboTwin 2.0) complétés par des essais réels limités en manipulation bimanuelle, sans précision sur le nombre de robots ou les sites concernés. JEPA-WAM s'inscrit dans la lignée des architectures d'apprentissage par prédiction latente issues de V-JEPA, et se positionne face à l'écosystème grandissant des politiques VLA telles que pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Les auteurs ne précisent aucun calendrier de suite, pilote industriel ou partenariat, ce qui situe cette publication au stade de la recherche fondamentale plutôt qu'à une étape de déploiement à court terme.

À lire aussi

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)
1arXiv cs.RO 

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)

Des chercheurs ont publié fin juillet 2026 un article arXiv (2607.29613) présentant le World Critic Model (WCM), une nouvelle architecture pour l'apprentissage par renforcement (RL) appliqué aux modèles Vision-Language-Action (VLA) utilisés en manipulation robotique. Le problème ciblé est celui des méthodes RL à base de critique, qui évaluent la valeur d'une action à partir d'une seule image ou d'un seul instant du flux visuel, un choix mal adapté au contrôle robotique où l'observation est par nature partielle et séquentielle. Bâti sur une architecture légère dérivée de LeJEPA, WCM prédit conjointement l'état latent futur de la scène et estime la valeur de l'action, ce qui force le critique à apprendre la dynamique temporelle plutôt qu'à simplement régresser un score. Le système s'intègre aux pipelines on-policy et off-policy et fonctionne avec les backbones VLA de référence Pi0, Pi0.5 et OpenVLA-OFT. Les auteurs rapportent des résultats état de l'art sur 149 tâches réparties sur quatre benchmarks, avec des gains marqués en généralisation hors distribution, ainsi qu'une validation sur sept tâches de manipulation réelles combinant OpenVLA-OFT et Pi0.5 en RL off-policy. L'enjeu dépasse la seule performance chiffrée: le RL post-entraînement des modèles VLA est aujourd'hui l'un des leviers les plus regardés pour fiabiliser les politiques robotiques au-delà de l'imitation pure, mais les critiques scalaires classiques peinent justement là où le contrôle réel exige de la mémoire et de l'anticipation. Si les gains de généralisation se confirment en dehors du cadre des benchmarks académiques, WCM pourrait devenir un composant standard pour les équipes qui affinent des VLA en production plutôt qu'une simple curiosité de laboratoire, en particulier pour les intégrateurs qui cherchent à réduire l'écart entre démonstration en simulation et déploiement réel. L'article s'inscrit dans la lignée des travaux récents sur l'apprentissage par prédiction de représentations latentes (JEPA, popularisé par Meta AI) appliqués à la robotique, et complète les approches critic-based existantes du RL pour VLA. Les auteurs ne précisent pas de plan de mise en open source ni de calendrier d'intégration dans des stacks robotiques commerciales; l'étape suivante logique serait une validation à plus grande échelle sur des plateformes industrielles.

RechercheActu
1 source
Real2Sim à base d'agents : modélisation physique du monde par agents vision-langage
2arXiv cs.RO 

Real2Sim à base d'agents : modélisation physique du monde par agents vision-langage

Optimus, Figure, Gr00t... la robotique humanoïde progresse vite en démos mais bute toujours sur un même verrou technique : reconstruire un environnement réel en simulation physique exploitable. Un article arXiv (2607.19190) présente Agentic Real2Sim, un framework qui utilise des agents vision-langage (VLA) pour automatiser cette conversion. Concrètement, à partir d'un simple enregistrement d'une interaction robot-objet dans le monde réel, le système génère un "jumeau épisodique" simulable, préservant les observations visuelles, les géométries de la scène, les états des objets et les mouvements du robot. Les auteurs ont testé leur approche sur trois familles de scénarios distinctes habituellement traitées par des pipelines séparés : manipulation d'objets rigides, interaction avec des objets déformables, et mouvements humanoïdes. Point notable, le framework peut fonctionner avec un modèle vision-langage open-weight, à une fraction du coût des modèles frontier (type GPT-4V ou équivalents propriétaires), tout en obtenant un taux de conversion réussie comparable. L'enjeu dépasse la seule prouesse académique. Le goulot d'étranglement du "real2sim" est aujourd'hui l'un des principaux freins à l'entraînement de politiques robotiques par apprentissage : sans environnement simulé fidèle, impossible d'entraîner ou d'évaluer massivement des modèles de contrôle sans multiplier les essais coûteux sur robot physique. Actuellement, ce travail repose sur du réglage manuel de modèles de vision, du nettoyage de maillages 3D et de l'alignement de repères de coordonnées, un processus lent et peu reproductible d'un labo à l'autre. Automatiser cette étape via des agents autonomes, capables de prendre eux-mêmes les décisions de pipeline, pourrait accélérer la constitution de jeux de données d'entraînement pour les politiques de type VLA, un sujet clé alors que des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2) cherchent à démontrer que leurs modèles généralisent au-delà des données d'entraînement. Ce travail s'inscrit dans une tendance plus large de recherche visant à combler l'écart entre simulation et réel (le "sim-to-real gap"), longtemps considéré comme l'un des obstacles majeurs à la robotique généraliste. Il ne s'agit ici que d'une publication de recherche, avec un site de projet public, et non d'un produit commercial ou d'un déploiement industriel : les auteurs eux-mêmes le présentent comme "un premier pas" vers une conversion real2sim généralisable et à l'échelle, sans préciser de calendrier de mise à disposition ou d'intégration dans des pipelines industriels existants.

RecherchePaper
1 source
SG-WAM : modélisation du monde auto-guidée dans un espace de politiques géométriquement conscient
3arXiv cs.RO 

SG-WAM : modélisation du monde auto-guidée dans un espace de politiques géométriquement conscient

Traduction et synthèse de l'article, en français, prêt à publier : SG-WAM (Self-Guided World Modeling in Geometry-Aware Policy Space) est un nouveau framework de recherche en robotique, publié sur arXiv (référence 2608.01397v1), qui s'attaque aux modèles World Action (WAM), ces systèmes qui couplent génération d'actions et prédiction des états futurs de la scène. La méthode introduit des "dynamics tokens" apprenables et un module appelé Self-Guided World Predictor, chargé de prévoir l'état latent futur de ces tokens en fonction des actions du robot. La supervision provient d'une copie à moyenne mobile exponentielle (EMA) du même réseau de politique, ce qui garantit une cohérence avec l'espace de représentation utilisé par le module de génération d'actions. Une supervision géométrique additionnelle structure les tokens d'image de la politique, apportant un ancrage spatial aux dynamics tokens. L'ensemble, prédiction latente, ancrage géométrique et génération d'actions par flow matching, est optimisé conjointement de bout en bout. Construit sur un modèle de seulement 0,9 milliard de paramètres, sans pré-entraînement embodied à grande échelle, SG-WAM atteint 98,5% de taux de réussite moyen sur le benchmark LIBERO et 73% sur LIBERO-Plus, tout en dépassant des baselines non précisément nommées dans l'abstract, aussi bien en conditions réelles similaires à l'entraînement qu'en généralisation hors distribution. L'enjeu identifié est concret: les WAM existants modélisent la dynamique future soit dans un espace d'observation brut, coûteux en calcul et peu aligné avec l'action, soit dans un espace latent auxiliaire non structuré pour la géométrie. En unifiant les deux dans l'espace même de la politique, SG-WAM évite ce compromis. Le résultat le plus notable reste la performance obtenue avec un modèle compact et sans pré-entraînement massif, ce qui questionne l'hypothèse dominante selon laquelle les modèles VLA nécessitent systématiquement une échelle de données et de paramètres considérable pour généraliser en conditions réelles. Le travail s'inscrit dans une lignée de recherche académique sur les world models appliqués à la manipulation robotique, où la prédiction d'état futur vient de plus en plus compléter les architectures de politique conditionnées par le langage. Il s'agit ici d'une contribution de recherche publiée en preprint, non d'un système déployé, et les baselines comparées ne sont pas explicitement identifiées dans le résumé, un point à vérifier dans le papier complet avant toute reprise de ces chiffres.

RecherchePaper
1 source
Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
4arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source