Aller au contenu principal
Superviser ce qui décide du succès : pertes auxiliaires alignées sur le critère pour la planification avec un modèle du monde latent
RecherchearXiv cs.RO 

Superviser ce qui décide du succès : pertes auxiliaires alignées sur le critère pour la planification avec un modèle du monde latent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode d'entraînement qui force les modèles du monde latents à conserver dans leur état interne les grandeurs physiques réellement utilisées pour juger la réussite d'une tâche. Le travail, publié sur arXiv (2610.01224), part d'un constat mesuré sur quatre modèles du monde latents : la position de l'effecteur terminal y est encodée avec une erreur supérieure à la tolérance du critère de succès. Dans ces conditions, l'état latent ne permet pas de distinguer un candidat réussi d'un candidat qui échoue. La correction est une perte auxiliaire : pendant l'entraînement, une tête linéaire branchée sur les sorties de l'encodeur et du prédicteur régresse les grandeurs du critère de succès, et l'erreur de régression s'ajoute à la perte d'apprentissage. La tête est supprimée ensuite, si bien que le modèle, son coût de calcul et ses entrées restent inchangés à l'inférence. Seule cette perte fait gagner 3,5 points de taux de succès (en absolu) sur PushT et 3,4 points sur la tâche du cube, deux écarts que les auteurs jugent statistiquement significatifs.

L'intérêt tient à la nature du défaut identifié. Les modèles du monde latents planifient en notant des séquences d'actions candidates par des distances dans l'espace latent, alors que le succès se juge en grandeurs physiques, comme une position à quelques millimètres près. Si le latent écrase ces grandeurs, le planificateur optimise un proxy mal aligné avec l'objectif réel, quelle que soit la qualité de la prédiction dynamique. Pour les équipes qui déploient ou évaluent ces modèles en manipulation, cela déplace la question : l'enjeu n'est pas seulement l'échelle ou l'architecture, mais ce que la représentation conserve. Le coût d'intégration est quasi nul, puisque rien ne change à l'inférence. Les gains restent toutefois modestes (environ 3 points) et mesurés sur des benchmarks de simulation relativement simples. Rien n'indique à ce stade qu'ils se transposent à des robots réels ou à des tâches à longue portée.

Le contexte est celui de la montée des modèles du monde latents de type JEPA, entraînés à prédire l'évolution d'un état compact plutôt que des pixels, et utilisés pour la planification par échantillonnage. Ces approches se positionnent face aux politiques VLA entraînées par imitation, comme Pi-0 ou GR00T, et aux modèles génératifs de vidéo. Leur promesse est un calcul plus léger à l'exécution, mais leur fiabilité dépend de la fidélité de l'espace latent. Les auteurs formulent ce principe de façon générale : le critère de succès définit ce que le modèle doit retenir. La suite logique serait de tester d'autres grandeurs de critère, d'autres tâches et des plateformes physiques. L'article est pour l'instant une prépublication, sans validation par les pairs ni déploiement annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Modèle du monde à action conditionnée : un planificateur d'action généralisable pour la prise de décision
1arXiv cs.RO 

Modèle du monde à action conditionnée : un planificateur d'action généralisable pour la prise de décision

Des chercheurs présentent World Action Planner (WAP), un système de planification robotique combinant un modèle vision-langage (VLM) et un modèle du monde conditionné par les poses et les images, capable de gérer plusieurs tâches. Décrit dans un article arXiv publié fin juillet 2026 (arXiv:2607.27599), le système fonctionne en deux temps : le VLM propose un plan d'action initial à partir d'une consigne, puis ce plan est raffiné de manière itérative par optimisation et recherche, en simulant des trajectoires possibles ("rollouts") dans le modèle du monde avant de les exécuter réellement. Selon les auteurs, WAP surpasse significativement les modèles de bout en bout de référence, à la fois les architectures vision-langage-action (VLA) et les modèles du monde purs (WAM), sur des tâches compositionnelles, des agencements de scène inédits et des scénarios de généralisation zéro-shot. Le projet est documenté sur worldactionplanner.github.io, sans précision sur le matériel robotique utilisé ni sur un calendrier de déploiement. L'enjeu dépasse la performance brute : c'est la capacité de généralisation qui est visée, un point faible connu des politiques par apprentissage par imitation, qui excellent dans leur environnement d'entraînement mais échouent souvent face à une scène ou une tâche nouvelle. En couplant raisonnement symbolique du VLM et vérification physique via simulation interne, WAP s'attaque directement à l'écart entre démonstration contrôlée et robustesse réelle, un sujet central pour les intégrateurs qui cherchent des robots capables de sortir du script préprogrammé. À ce stade, il s'agit toutefois d'un résultat de recherche évalué en simulation ou en environnement contrôlé, pas d'un produit commercial ni d'un déploiement industriel. Ce travail s'inscrit dans la course actuelle autour des modèles VLA (à l'image de Pi-0 ou GR00T N2) et des modèles du monde pour la robotique, deux approches concurrentes pour doter les robots humanoïdes et bras manipulateurs d'une autonomie généralisable. En proposant une architecture hybride qui combine planification par recherche et prédiction du monde plutôt qu'une politique end-to-end unique, les auteurs positionnent WAP comme une alternative aux approches purement VLA, dont les limites de généralisation restent un point de friction reconnu dans le secteur.

RecherchePaper
1 source
ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
2arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source
Les limites de planification des modèles du monde latents
3arXiv cs.RO 

Les limites de planification des modèles du monde latents

Une étude publiée sur arXiv (2609.39235) cartographie les limites de planification des modèles du monde latents, ces prédicteurs censés permettre à un robot d'« imaginer » l'évolution de son environnement avant d'agir. Les auteurs construisent des prédicteurs conditionnés par l'action sur cinq encodeurs visuels auto-supervisés gelés : V-JEPA 2, V-JEPA 2.1, VideoMAEv2, VideoPrism et DINOv2. Ils les évaluent sur diverses tâches de manipulation Meta-World et sur des interactions réelles tirées de BridgeData V2. Avec des rollouts de cinq pas, longueur d'entraînement du prédicteur, le modèle ne classe correctement les actions que pour des cibles situées 5 à 10 pas de contrôle plus loin, alors que les objectifs des tâches se trouvent à 16 à 53 pas. Un prédicteur 81 fois plus grand ou un entraînement sur des rollouts plus longs n'étendent pas cette portée. L'encodeur, lui, influence la portée et le succès en boucle fermée, V-JEPA 2.1 se montrant le plus régulier. Le point le plus significatif est que cette limite ne vient pas d'une prédiction imparfaite. Avec le vrai simulateur, donc une prédiction parfaite, le succès tombe de 92 % à 41 % lorsque la cible passe de 5 à 20 pas au-delà d'un rollout de cinq pas. Le goulet d'étranglement est donc la structure de la planification, pas seulement la qualité du modèle. Pour des objectifs lointains, l'imagination pure réussit dans 23 % des épisodes, la planification avec retour d'information (MPC) monte à 30 %, un rollout aussi long que la distance à l'objectif atteint 47 %, et des sous-objectifs experts proches atteignent 76 %. Pour les intégrateurs et les équipes R&D, cela tempère l'idée qu'il suffit de grossir le modèle ou les données : il faut des horizons imaginés plus longs ou une décomposition hiérarchique en sous-objectifs. Cela invite aussi à lire avec prudence les démonstrations qui montrent ce que ces modèles réussissent sans préciser à quelle distance se trouvait le but. L'étude arrive alors que les modèles du monde de la famille JEPA, portés par Meta, sont présentés comme une voie vers des robots généralistes, en concurrence avec les approches VLA (vision-langage-action) qui prédisent directement les actions. Les auteurs montrent une complémentarité : dans sa plage de planification, un modèle du monde peut filtrer huit actions proposées par une politique VLA et faire passer son succès de 65 % à 77 % sur 16 tâches. Il s'agit de résultats académiques, en simulation et sur données robotiques existantes, sans déploiement industriel ni produit annoncé. Les suites probables portent sur des rollouts plus longs, des sous-objectifs générés automatiquement et l'intégration à des VLA, sans calendrier précisé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Au-delà de l'alignement de politique : boucler la planification et l'apprentissage pour le contrôle de robots avec des modèles du monde appris
4arXiv cs.RO 

Au-delà de l'alignement de politique : boucler la planification et l'apprentissage pour le contrôle de robots avec des modèles du monde appris

Des chercheurs proposent PL-MPC (Planning-Learning MPC), une évolution de TD-MPC, la famille de méthodes qui combine un modèle du monde appris, une optimisation de trajectoire en ligne (MPPI) et des fonctions de valeur et de politique apprises. Trois modifications sont introduites, sans toucher à l'architecture du modèle du monde ni à l'optimiseur. Des cibles TD multi-étapes hybrides exposent le critique à davantage de récompenses réellement observées avant le bootstrap. Une estimation de valeur terminale sensible au désaccord entre critiques réduit le poids des valeurs incertaines pendant la planification. Enfin, une distillation de l'acteur pondérée par le retour privilégie les actions exécutées par le planificateur dans les épisodes les plus rentables. Sur HumanoidBench, le Total Average Return passe de 98±18 à 387±255 sur balance-hard, et de 199±13 à 466±200 sur hurdle. Les résultats restent dépendants de la tâche sur le reste du benchmark, et la méthode demeure compétitive sur DMControl. Un test de transfert sim-to-real zero-shot est réalisé sur l'alignement d'un écrou avec une clé, avec un bras KUKA IIWA14 à 7 DoF. Le taux de succès observé est supérieur à celui de TD-M(PC)^2, pour la taille d'objet d'entraînement et deux tailles inédites. Code et données doivent être publiés ultérieurement. L'intérêt tient à la manière dont le problème est posé. Le planificateur génère les données dont le critique et l'acteur apprennent, et ceux-ci notent et proposent à leur tour les plans futurs : les erreurs de valeur peuvent donc se renforcer d'un cycle à l'autre. Les variantes précédentes se contentaient d'aligner la politique sur le comportement du planificateur. PL-MPC traite aussi la supervision du critique et la valeur terminale, ce qui suggère que les gains viennent de la boucle entière plutôt que d'un seul composant. Il faut toutefois lire les chiffres avec prudence. Les écarts-types sont très larges (387±255, 466±200), les gains se concentrent sur deux tâches, et les ablations montrent que les composants interagissent différemment d'une tâche à l'autre. Le test sim-to-real reste un seul scénario sur bras fixe, sans aucune mesure sur un humanoïde réel : il ne dit rien du passage à l'échelle sur des robots à corps entier. Ce travail prolonge TD-MPC et TD-MPC2, références du contrôle basé sur modèle du monde pour les systèmes de grande dimension, ainsi que TD-M(PC)^2, variante contrainte par la politique qui sert ici de point de comparaison direct. Il se positionne en recherche amont, à distance des approches VLA généralistes (Pi-0, GR00T, Helix) qui dominent les annonces industrielles. HumanoidBench reste un banc d'essai simulé, et un transfert réussi sur un bras industriel ne garantit pas la robustesse sur un humanoïde. La suite dépendra de la publication du code et des données annoncés sur pl-mpc-humanoid.github.io, puis d'éventuelles validations sur matériel humanoïde.

RecherchePaper
1 source