Aller au contenu principal
Modèle du monde ancré : planification latente guidée par des objectifs en langage naturel
RecherchearXiv cs.RO 

Modèle du monde ancré : planification latente guidée par des objectifs en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent le Grounded World Model (GWM), un modèle du monde latent qui permet de planifier en zero-shot, dans le monde réel, à partir d'une simple instruction en langage naturel. Les modèles précédents, comme DINO-WM et LeWM, exigent une image du but, difficile à obtenir à l'avance pour une tâche inédite. GWM, lui, prédit l'avenir dans l'espace visuel d'un modèle d'embedding vidéo-langage pré-entraîné, à partir d'une séquence d'actions candidate et de l'observation courante. La lecture figée de cet embedding projette le futur imaginé et la description de la tâche dans le même espace, et l'opposé de leur similarité cosinus sert de coût de planification. L'entraînement n'utilise que des paires vidéo-action hors ligne, sans lien avec une tâche précise, et aucune annotation linguistique. Sur le benchmark simulé WISER, la planification avec GWM résout 87 % de 288 tâches aux instructions et signaux visuels inédits, contre 22 % en moyenne pour dix VLA affinés. Avec des données de robots réels, sous IsaacSim, GWM réussit les 70 essais répartis sur 14 tâches de désignation par expressions référentielles, comme un planificateur modulaire guidé par un VLM de pointe, alors que pi0.5 en réussit 37 sur 70. Sur un bras Franka réel, le système complète 55 sous-tâches de pick-and-place sur 60, contre 52 sur 60 pour le planificateur modulaire.

Ces résultats déplacent le débat sur l'architecture des robots pilotés par le langage. Les VLA affinés dominent aujourd'hui les démonstrations, mais le contraste est net dès qu'on change les instructions ou les signaux visuels : 22 % contre 87 % suggère que la généralisation de ces politiques reste fragile hors distribution. À l'inverse, planifier en simulant des futurs et en les évaluant par similarité sémantique évite de réentraîner un modèle pour chaque tâche et ne demande aucune donnée annotée en langage, ce qui réduit un goulot d'étranglement de collecte. Pour un intégrateur, l'argument pratique est que l'ensemble tourne en local sur un seul GPU grand public, sans appel à un VLM propriétaire distant. Il faut toutefois rester prudent : les 60 essais réels portent sur des tâches de pick-and-place sur un seul type de bras, la différence avec le planificateur modulaire (55 contre 52) n'est pas significative statistiquement, et WISER est un benchmark conçu par les auteurs. Le temps de calcul par décision n'est pas détaillé dans le résumé.

Ce travail prolonge la lignée des modèles du monde latents pour la manipulation, portée par DINO-WM puis LeWM, en levant la contrainte du but visuel. Il se positionne face aux VLA généralistes comme pi0.5, et face aux architectures modulaires où un VLM de pointe décompose la tâche et un module de bas niveau l'exécute. La version 2 de l'article sur arXiv (2604.11751) et un site de projet sont disponibles, mais aucun déploiement industriel ni calendrier de transfert n'est annoncé. Les prochaines étapes probables sont des tests sur des tâches plus longues, des manipulations plus dextres et d'autres plateformes que le Franka, avant de savoir si cette approche tient hors du laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Les limites de planification des modèles du monde latents
1arXiv cs.RO 

Les limites de planification des modèles du monde latents

Une étude publiée sur arXiv (2609.39235) cartographie les limites de planification des modèles du monde latents, ces prédicteurs censés permettre à un robot d'« imaginer » l'évolution de son environnement avant d'agir. Les auteurs construisent des prédicteurs conditionnés par l'action sur cinq encodeurs visuels auto-supervisés gelés : V-JEPA 2, V-JEPA 2.1, VideoMAEv2, VideoPrism et DINOv2. Ils les évaluent sur diverses tâches de manipulation Meta-World et sur des interactions réelles tirées de BridgeData V2. Avec des rollouts de cinq pas, longueur d'entraînement du prédicteur, le modèle ne classe correctement les actions que pour des cibles situées 5 à 10 pas de contrôle plus loin, alors que les objectifs des tâches se trouvent à 16 à 53 pas. Un prédicteur 81 fois plus grand ou un entraînement sur des rollouts plus longs n'étendent pas cette portée. L'encodeur, lui, influence la portée et le succès en boucle fermée, V-JEPA 2.1 se montrant le plus régulier. Le point le plus significatif est que cette limite ne vient pas d'une prédiction imparfaite. Avec le vrai simulateur, donc une prédiction parfaite, le succès tombe de 92 % à 41 % lorsque la cible passe de 5 à 20 pas au-delà d'un rollout de cinq pas. Le goulet d'étranglement est donc la structure de la planification, pas seulement la qualité du modèle. Pour des objectifs lointains, l'imagination pure réussit dans 23 % des épisodes, la planification avec retour d'information (MPC) monte à 30 %, un rollout aussi long que la distance à l'objectif atteint 47 %, et des sous-objectifs experts proches atteignent 76 %. Pour les intégrateurs et les équipes R&D, cela tempère l'idée qu'il suffit de grossir le modèle ou les données : il faut des horizons imaginés plus longs ou une décomposition hiérarchique en sous-objectifs. Cela invite aussi à lire avec prudence les démonstrations qui montrent ce que ces modèles réussissent sans préciser à quelle distance se trouvait le but. L'étude arrive alors que les modèles du monde de la famille JEPA, portés par Meta, sont présentés comme une voie vers des robots généralistes, en concurrence avec les approches VLA (vision-langage-action) qui prédisent directement les actions. Les auteurs montrent une complémentarité : dans sa plage de planification, un modèle du monde peut filtrer huit actions proposées par une politique VLA et faire passer son succès de 65 % à 77 % sur 16 tâches. Il s'agit de résultats académiques, en simulation et sur données robotiques existantes, sans déploiement industriel ni produit annoncé. Les suites probables portent sur des rollouts plus longs, des sous-objectifs générés automatiquement et l'intégration à des VLA, sans calendrier précisé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
2arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)

Des chercheurs proposent V-VLAPS (Value-Guided Vision-Language-Action Planning and Search), une méthode qui augmente les modèles VLA (Vision-Language-Action) d'un signal de valeur appris pour améliorer la planification en manipulation robotique. Les VLA encodent perception visuelle, langage et commande motrice pour générer des actions, mais leur comportement purement réactif se dégrade hors distribution d'entraînement ou sur des tâches à horizon long. V-VLAPS ajoute une tête de valeur légère (value head), entraînée sur des trajectoires hors-ligne (offline rollouts), qui prédit les retours Monte Carlo et guide un MCTS (Monte Carlo Tree Search) vers les branches de plus haute valeur. Sur les cinq suites du benchmark LIBERO, V-VLAPS égale la baseline sans valeur au budget de recherche standard ; avec un budget élargi, il la dépasse dans toutes les suites, avec +6 points de pourcentage sur LIBERO-Object et +4 points sur LIBERO-10. L'apport central est de démontrer que les représentations internes des VLA encodent non seulement des informations sur l'échec d'une trajectoire (déjà documenté dans la littérature), mais peuvent aussi estimer la valeur pendant la planification. Cela ouvre une voie pragmatique pour les intégrateurs : renforcer des politiques VLA existantes sans réentraînement complet, par simple ajout d'une tête de valeur et d'un budget de recherche accru. L'analyse révèle toutefois une limite claire : la majorité des échecs durs sont des timeouts au niveau racine, là où les valeurs prédites restent peu différenciées, ce qui plafonne le gain observé et indique que le signal de valeur est encore insuffisamment discriminant en début de trajectoire. Ce travail (préprint arXiv, janvier 2026) s'inscrit dans une série de méthodes cherchant à coupler la puissance générative des VLA modernes (RT-2, OpenVLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) avec des mécanismes de planification structurée, face aux approches concurrentes par world models et diffusion planifiante. Les résultats sont obtenus uniquement en simulation sur LIBERO et ne sont pas encore validés sur robot réel, limite classique de ce type de contribution arxiv. La prochaine étape naturelle est une évaluation sim-to-real pour vérifier si le signal de valeur appris se transfère hors simulation, notamment sur des tâches à contacts complexes ou en environnement non structuré.

RechercheOpinion
1 source
Vers des modèles du monde JEPA ancrés dans la réalité physique pour la planification robotique conditionnée par objectif
4arXiv cs.RO 

Vers des modèles du monde JEPA ancrés dans la réalité physique pour la planification robotique conditionnée par objectif

Des chercheurs publient sur arXiv (arXiv:2609.03565, soumis début septembre 2026) un modèle du monde de type JEPA (Joint Embedding Predictive Architecture) conçu pour la planification robotique conditionnée par des objectifs visuels. L'approche standard JEPA prédit les représentations latentes futures sans reconstruire les pixels, mais rien ne garantit que ces représentations conservent l'information utile au contrôle moteur. Les auteurs ajoutent deux mécanismes entraînés de bout en bout : une dynamique inverse (IDM), qui empêche l'effondrement des représentations latentes en les forçant à rester informatives sur les actions qui les ont produites, et un alignement d'état (state alignment, SA), qui ancre les représentations successives dans la configuration physique et le mouvement réels du robot. Testé sur quatre bancs d'essai de planification, le modèle atteint 100% de réussite sur TwoRoom, 98% sur PushT et 87% sur OGBench-Cube, avec des résultats comparables à la référence LeWorldModel sur la tâche Reacher. Une étude d'ablation montre que l'ajout du state alignment améliore systématiquement le taux de réussite par rapport à l'IDM seul, sur les quatre tâches. Ce travail s'inscrit dans un débat central pour l'industrie robotique actuelle : les modèles du monde appris en espace latent permettent-ils une planification fiable, ou souffrent-ils d'un écart entre performance en simulation et robustesse réelle ? En montrant que l'ancrage physique explicite des représentations améliore la planification sans reconstruction pixel par pixel, les auteurs apportent un argument technique en faveur d'architectures latentes plus légères que les approches génératives complètes, un enjeu direct pour les intégrateurs qui cherchent des modèles de contrôle moins gourmands en calcul que les VLA (vision-language-action) de type Pi-0, GR00T N2 ou Helix. L'analyse par sous-espace de transition est particulièrement notable : bien que LeWorldModel affiche une meilleure "rectitude" moyenne des trajectoires sur OGBench-Cube, ses transitions se concentrent dans un sous-espace de dimension effective plus faible, ce qui suggère une représentation moins riche malgré des métriques agrégées favorables, un rappel que les chiffres moyens seuls peuvent masquer des limites structurelles. Ce papier prolonge la lignée des travaux sur les architectures JEPA popularisées en vision par Meta AI, désormais transposées à la robotique pour contourner les coûts de la prédiction pixel par pixel propre aux modèles du monde génératifs. Il se positionne comme une contribution de recherche académique, évaluée sur des bancs d'essai simulés standardisés (TwoRoom, PushT, Reacher, OGBench-Cube), sans annonce de déploiement matériel ni de partenariat industriel. Les prochaines étapes naturelles, non abordées dans l'abstract, seraient une validation sur robot physique et une comparaison directe avec les architectures VLA à grande échelle qui dominent actuellement les annonces commerciales du secteur.

RecherchePaper
1 source