Aller au contenu principal
Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides
RecherchearXiv cs.RO 

Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié sur arXiv (arXiv:2512.08411v2, décembre 2025) le Prismatic World Model (PRISM-WM), une architecture de modèle du monde destinée à améliorer la planification dans les systèmes robotiques à dynamiques hybrides. Le problème central que PRISM-WM cherche à résoudre est structurel : les mouvements continus sont régulièrement interrompus par des événements discrets, contacts, impacts, transitions de phases (vol vs appui, glissement vs adhérence), qui créent des discontinuités difficiles à modéliser. Les architectures classiques à réseaux neuronaux monolithiques, comme les modèles latents de type RSSM ou DreamerV3, imposent une continuité globale qui lisse ces transitions et génère des erreurs cumulatives lors des simulations à long horizon (rollouts), rendant la planification peu fiable aux frontières physiques. PRISM-WM y répond par un cadre Mixture-of-Experts (MoE) contextuel : un mécanisme de gating identifie implicitement le mode physique courant, et des experts spécialisés prédisent la dynamique de transition associée. Une contrainte d'orthogonalisation latente force la diversité des experts, prévenant l'effondrement de modes. Les expériences portent sur des benchmarks de contrôle continu incluant des humanoïdes haute dimension et des configurations multi-tâches, couplés à l'algorithme d'optimisation de trajectoires TD-MPC.

Les résultats montrent que PRISM-WM réduit le drift en simulation lors des rollouts étendus, offrant un substrat de haute fidélité pour les algorithmes d'optimisation de trajectoires. Pour les équipes de contrôle en robotique humanoïde, cela adresse directement le gap simulation-réalité lié à la gestion des contacts, une limitation structurelle des approches model-based existantes. La décomposition en primitives composables ouvre aussi une piste vers des architectures plus interprétables, un enjeu concret pour les déploiements industriels où la robustesse aux variations de terrain ou de tâche est critique.

PRISM-WM s'inscrit dans la dynamique des world models pour la robotique, domaine en forte progression depuis les travaux de Hafner et al. sur DreamerV3 et les avancées de TD-MPC sur des tâches de locomotion complexe. L'approche MoE transposée à la dynamique physique rejoint des tendances observées dans les grands modèles de langage (Mixtral, GPT-4). Il n'est pas associé à une entreprise commerciale identifiée ; il s'agit d'une contribution académique pure, sans pilote industriel annoncé. La prochaine étape logique serait une validation sur hardware réel, notamment sur des plateformes humanoïdes où la gestion des contacts reste un verrou technique central de la sim-to-real transfer.

Dans nos dossiers

À lire aussi

Point Completion 3D pour les modèles du monde : une méthode plus précise d'apprentissage de la dynamique
1arXiv cs.RO 

Point Completion 3D pour les modèles du monde : une méthode plus précise d'apprentissage de la dynamique

Les faits d'abord : une équipe de recherche présente sur arXiv (juillet 2026) 3DPWM, un modèle de monde en 3D conçu pour la planification robotique. Contrairement aux modèles de dynamique fondés sur la vidéo, largement utilisés aujourd'hui pour prédire les conséquences d'une action avant de l'exécuter, 3DPWM travaille directement dans l'espace 3D : il complète d'abord les nuages de points partiels captés par les capteurs (souvent incomplets à cause des occlusions), puis apprend une dynamique conditionnée par l'action sur cette géométrie reconstituée. Le modèle est qualifié de "task-agnostic", c'est-à-dire réutilisable d'une tâche à l'autre sans réentraînement complet. Testé sur plusieurs incarnations robotiques et plusieurs bancs d'essai de manipulation sur table, il produit des trajectoires prédictives fiables sur 100 à 300 pas de temps et plus, fonctionne en boucle ouverte comme en boucle fermée, et démontre un transfert réussi de la simulation vers le réel. L'enjeu porte sur un problème central de la robotique fondée sur l'apprentissage : les modèles de monde vidéo, bien que puissants pour générer des scènes plausibles, dérivent géométriquement sur les horizons longs, accumulant des erreurs qui rendent la planification peu fiable au-delà de quelques dizaines de pas. Les modèles 3D à base de nuages de points partiels corrigent en partie ce défaut mais restent vulnérables aux occlusions et à la dérive de prédiction. En comblant explicitement les trous de la géométrie observée avant de simuler la dynamique, 3DPWM attaque directement ce goulot d'étranglement. Pour les équipes qui travaillent sur la planification par modèle (model-based planning), c'est un signal que la fiabilité sur le long terme, condition nécessaire pour improviser des solutions sur des tâches nouvelles, reste atteignable sans reposer uniquement sur des modèles vidéo massifs coûteux à entraîner. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles de monde pour la robotique, une famille qui inclut aussi bien les approches génératives vidéo que les architectures VLA (vision-langage-action) type Pi-0 ou GR00T N2, davantage orientées vers l'exécution directe que vers la planification explicite. La démonstration d'un transfert sim-to-real réussi est le test classique pour juger la maturité d'une méthode de ce type, avant toute adoption industrielle. À ce stade, il s'agit d'une publication de recherche accompagnée de résultats expérimentaux sur bancs d'essai standards, sans déploiement produit ni partenariat industriel annoncé ; la suite logique serait une validation sur des plateformes robotiques réelles au-delà des configurations de laboratoire testées.

RecherchePaper
1 source
Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)
2arXiv cs.RO 

Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)

Des chercheurs ont publié le 21 avril 2026 un article sur arXiv (2604.14732) présentant le modèle WAV (World-Value-Action), une architecture unifiée destinée à améliorer les capacités de planification des systèmes Vision-Language-Action (VLA). Les VLA sont des modèles qui ancrent la perception visuelle et les instructions en langage naturel dans des commandes motrices directes, une approche devenue centrale dans la robotique généraliste ces deux dernières années. Le problème ciblé par WAV est précis : la majorité des VLA actuels prédisent les actions de manière directe (un état visuel + une instruction = une action), sans modéliser les conséquences à long terme de leurs décisions. Le modèle WAV introduit à la place une représentation latente structurée des trajectoires futures, conditionnée sur les observations visuelles et les instructions. Un modèle de monde (world model) prédit les états futurs, tandis qu'une fonction de valeur de trajectoire (trajectory value function) évalue leur utilité à horizon long. La génération d'action est ensuite formulée comme une inférence dans cet espace latent, où le modèle concentre progressivement la masse de probabilité sur les trajectoires à haute valeur et dynamiquement réalisables. L'apport théorique central est démontré formellement : planifier directement dans l'espace des actions entraîne une décroissance exponentielle de la probabilité de trajectoires réalisables à mesure que l'horizon s'allonge, un obstacle fondamental pour toute tâche nécessitant plusieurs étapes enchaînées. L'inférence dans l'espace latent restructure la distribution de recherche vers des régions réalisables, ce qui rend la planification à long horizon tractable. En pratique, WAV surpasse les méthodes de l'état de l'art en simulation et dans des expériences réelles, avec des gains mesurables sur le taux de succès des tâches, la capacité de généralisation et la robustesse, notamment dans les scénarios compositionnels et à horizon long. Pour les intégrateurs industriels et les équipes de robotique, cela signifie potentiellement un meilleur comportement dans les tâches en plusieurs étapes, assemblage, manipulation séquentielle, sans avoir à pré-programmer des graphes de tâches explicites. Les VLA ont connu une accélération notable depuis fin 2023, avec des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA (Berkeley) qui ont validé l'approche d'un modèle fondationnel pour la manipulation robotique. La plupart de ces architectures partagent le défaut que WAV cherche à corriger : l'absence de raisonnement causal sur les conséquences des actions. Des approches concurrentes comme SWIM (Sequential World Inference Models) ou les travaux de Dreamer appliqués à la robotique explorent des pistes similaires via des world models explicites, mais WAV tente d'intégrer planning implicite et génération d'action dans un seul cadre d'entraînement. Le code est disponible publiquement sur GitHub (Win-commit/WAV). Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article, il s'agit pour l'instant d'une publication académique, sans produit shipped ni pilote annoncé.

RechercheActu
1 source
DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique
3arXiv cs.RO 

DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25631v1) DynaForge, un framework destiné à générer automatiquement des démonstrations de manipulation dynamique d'objets pour l'entraînement de politiques robotiques par apprentissage par imitation. Le système combine une planification globale à basse fréquence avec une cinématique inverse centrée sur l'objet à haute fréquence, puis applique une politique résiduelle pour corriger les actions au moment critique du contact. Un curriculum implicite regroupe les tentatives par conditions similaires et privilégie les lots à succès mixte, concentrant l'apprentissage par renforcement résiduel sur la frontière de compétence en évolution. Sur les tâches Can et Bottle, DynaForge nécessite 0,73 fois moins d'étapes d'optimisation que l'algorithme GRPO standard pour un budget d'étapes d'environnement identique, avec un taux de succès final supérieur. Sur neuf tâches de simulation, le taux moyen de génération de démonstrations réussies passe de 41,30% avec la seule planification a priori à 78,37% avec DynaForge. Avec 800 démonstrations par tâche, des politiques DP3 entraînées sur ces données atteignent 49,11% de succès moyen, contre 7,07% pour des données générées par la méthode concurrente DOMINO. Sur trois tâches dynamiques réelles, les politiques entraînées avec DynaForge obtiennent entre 30% et 60% de succès, contre 0% à 10% pour celles issues de DOMINO. La manipulation dynamique, lancer, attraper au vol, gestes exigeant une réaction rapide au contact, reste un point faible des pipelines d'apprentissage par imitation, car les démonstrations générées automatiquement échouent souvent près du contact ou simplifient excessivement l'interaction physique, comme le fait le rejeu à la DOMINO. En améliorant nettement le taux de génération de démonstrations exploitables tout en réduisant le coût de calcul par rapport à des méthodes de renforcement classiques comme GRPO, DynaForge s'attaque directement au goulot d'étranglement des données qui freine l'entraînement de politiques à grande échelle, qu'il s'agisse de politiques de diffusion comme DP3 ou de modèles vision-langage-action plus larges. L'écart de 20 à 50 points de succès observé en conditions réelles suggère que ces démonstrations reflètent mieux la dynamique physique que les méthodes précédentes, un enjeu central pour les intégrateurs qui cherchent à transférer des politiques entraînées en simulation vers du matériel réel sans réentraînement coûteux. DynaForge se positionne explicitement face à deux familles de méthodes existantes: les approches purement basées sur la planification, sujettes à l'échec au moment du contact, et DOMINO, qui simplifie les interactions dynamiques au prix du réalisme. Le recours à GRPO, algorithme d'optimisation de politique par groupe popularisé dans l'entraînement de modèles de langage, illustre la porosité croissante entre techniques de renforcement issues du traitement du langage et robotique. Le résumé ne précise ni affiliation institutionnelle ni disponibilité du code, et la validation réelle reste limitée à trois tâches sans détail sur le nombre d'essais, ce qui invite à la prudence avant toute extrapolation à un déploiement industriel.

RecherchePaper
1 source
Évaluation comparative des modèles du monde pour l'apprentissage continu sur des tâches compositionnelles
4arXiv cs.RO 

Évaluation comparative des modèles du monde pour l'apprentissage continu sur des tâches compositionnelles

Un article publié sur arXiv (2609.22055v1, section cross-listing) présente un nouveau benchmark destiné à évaluer la capacité des "world models" à apprendre en continu sur des tâches de manipulation robotique. Baptisé benchmark de continual learning compositionnel, l'outil construit des séquences de tâches où chaque nouvelle tâche recombine des éléments déjà rencontrés, en factorisant cette composition selon deux axes distincts : l'action et la perception. L'objectif est de séparer deux capacités souvent confondues dans les mesures d'adaptation classiques, la vitesse d'apprentissage de tâches inédites d'un côté, la réutilisation de connaissances déjà acquises de l'autre. Les auteurs testent plusieurs world models considérés comme état de l'art, combinés à des méthodes de continual learning standards, ainsi qu'un modèle modulaire dont le socle de dynamique intègre des composants explicitement conçus pour être réutilisés. Le code et les détails du benchmark sont publiés sur un site dédié au projet, object814.github.io/Compositional-Continual-Learning. Le résultat central est que l'architecture modulaire offre un meilleur compromis entre réutilisation des connaissances et oubli catastrophique que les méthodes de continual learning conventionnelles, mais qu'aucune approche testée ne résout le problème dans son ensemble. Pour les laboratoires qui développent des modèles génériques de type VLA destinés à équiper des robots manipulateurs en usine ou en logistique, ce constat vient nuancer l'hypothèse implicite selon laquelle un modèle suffisamment large finirait par s'adapter à de nouveaux environnements sans réentraînement complet ni perte de performance sur les tâches antérieures. Le benchmark fournit en somme un outil de diagnostic plus rigoureux que les mesures d'adaptation globales habituellement citées dans les communiqués sur les robots généralistes, en isolant précisément où l'apprentissage échoue. Ce travail s'inscrit dans la continuité des recherches sur le continual learning appliqué à la robotique, un champ où les benchmarks existants mesuraient rarement séparément la vitesse d'apprentissage et la réutilisation de connaissances. En se concentrant spécifiquement sur les world models, composants de plus en plus centraux dans les architectures de contrôle robotique moderne, les auteurs positionnent leur contribution comme un outil d'évaluation plutôt qu'un nouveau modèle concurrent. La publication du benchmark en accès libre laisse présager son adoption par d'autres équipes pour tester leurs propres architectures, sans qu'aucun calendrier de déploiement industriel ne soit annoncé à ce stade.

RecherchePaper
1 source