Prismatic World Model : apprentissage de la dynamique c…

Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)

46

1arXiv cs.RO

Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)

Des chercheurs ont publié le 21 avril 2026 un article sur arXiv (2604.14732) présentant le modèle WAV (World-Value-Action), une architecture unifiée destinée à améliorer les capacités de planification des systèmes Vision-Language-Action (VLA). Les VLA sont des modèles qui ancrent la perception visuelle et les instructions en langage naturel dans des commandes motrices directes, une approche devenue centrale dans la robotique généraliste ces deux dernières années. Le problème ciblé par WAV est précis : la majorité des VLA actuels prédisent les actions de manière directe (un état visuel + une instruction = une action), sans modéliser les conséquences à long terme de leurs décisions. Le modèle WAV introduit à la place une représentation latente structurée des trajectoires futures, conditionnée sur les observations visuelles et les instructions. Un modèle de monde (world model) prédit les états futurs, tandis qu'une fonction de valeur de trajectoire (trajectory value function) évalue leur utilité à horizon long. La génération d'action est ensuite formulée comme une inférence dans cet espace latent, où le modèle concentre progressivement la masse de probabilité sur les trajectoires à haute valeur et dynamiquement réalisables. L'apport théorique central est démontré formellement : planifier directement dans l'espace des actions entraîne une décroissance exponentielle de la probabilité de trajectoires réalisables à mesure que l'horizon s'allonge, un obstacle fondamental pour toute tâche nécessitant plusieurs étapes enchaînées. L'inférence dans l'espace latent restructure la distribution de recherche vers des régions réalisables, ce qui rend la planification à long horizon tractable. En pratique, WAV surpasse les méthodes de l'état de l'art en simulation et dans des expériences réelles, avec des gains mesurables sur le taux de succès des tâches, la capacité de généralisation et la robustesse, notamment dans les scénarios compositionnels et à horizon long. Pour les intégrateurs industriels et les équipes de robotique, cela signifie potentiellement un meilleur comportement dans les tâches en plusieurs étapes, assemblage, manipulation séquentielle, sans avoir à pré-programmer des graphes de tâches explicites. Les VLA ont connu une accélération notable depuis fin 2023, avec des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA (Berkeley) qui ont validé l'approche d'un modèle fondationnel pour la manipulation robotique. La plupart de ces architectures partagent le défaut que WAV cherche à corriger : l'absence de raisonnement causal sur les conséquences des actions. Des approches concurrentes comme SWIM (Sequential World Inference Models) ou les travaux de Dreamer appliqués à la robotique explorent des pistes similaires via des world models explicites, mais WAV tente d'intégrer planning implicite et génération d'action dans un seul cadre d'entraînement. Le code est disponible publiquement sur GitHub (Win-commit/WAV). Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article, il s'agit pour l'instant d'une publication académique, sans produit shipped ni pilote annoncé.

RechercheActu

1 source

Wiggle and Go! : identification du système pour la manipulation dynamique de corde sans démonstration

42

2arXiv cs.RO

Wiggle and Go! : identification du système pour la manipulation dynamique de corde sans démonstration

Des chercheurs ont publié fin avril 2026 sur arXiv (2604.22102) un système baptisé "Wiggle and Go!" capable de manipuler dynamiquement une corde en zero-shot, c'est-à-dire sans essais préalables sur la tâche cible ni jeu de données réel spécifique à cette tâche. L'architecture repose sur deux étages : un module d'identification système qui observe le comportement mécanique de la corde en la faisant "osciller" brièvement, prédit ses paramètres physiques descriptifs (raideur, amortissement, distribution de masse), puis transmet ces paramètres à un optimiseur qui génère les commandes motrices pour exécuter la tâche. Sur une tâche de frappe 3D d'une cible avec la corde, le système atteint une précision moyenne de 3,55 cm, contre 15,34 cm lorsque les paramètres de la corde ne sont pas pris en compte, soit une réduction d'erreur d'un facteur supérieur à 4. Le coefficient de corrélation de Pearson entre les fréquences de Fourier des trajectoires simulées et réelles atteint 0,95 sur des trajectoires non vues pendant l'entraînement. L'intérêt technique de cette approche est de découpler l'identification de l'objet de la politique de manipulation : un seul module d'identification système alimente plusieurs politiques différentes sans réentraînement, ce qui permet de basculer entre tâches (frappe, lancer, enroulement) sans collecte de données réelles supplémentaires. C'est précisément ce point qui est structurellement difficile dans la manipulation d'objets déformables : les cordes, câbles et textiles n'ont pas de modèle physique fixe, leur comportement varie selon le matériau, la longueur et l'humidité. Les approches concurrentes exigent soit des milliers d'essais réels pour calibrer un modèle, soit des itérations successives sur la tâche elle-même. "Wiggle and Go!" contourne les deux en exploitant des priors de simulation appris, avec une phase d'observation courte et non destructive. La manipulation d'objets déformables est un problème ouvert en robotique depuis plus d'une décennie, avec des applications directes en logistique (câblage, lien de paquets), en chirurgie assistée et en industrie textile. Le sim-to-real reste le verrou central : les moteurs physiques peinent à reproduire le comportement non-linéaire des matériaux souples, et la moindre erreur sur un lancer dynamique est irrécupérable, comme le soulignent explicitement les auteurs. Des équipes comme celle de Pieter Abbeel (UC Berkeley) ou Deepak Pathak (CMU) travaillent sur des approches comparables par apprentissage par renforcement ou diffusion de trajectoires, mais souvent avec des données réelles massives. Ce travail s'inscrit dans une tendance croissante vers la robotique fondée sur l'identification physique légère plutôt que sur la collecte de données exhaustive, une direction qui intéresse particulièrement les intégrateurs industriels confrontés à des environnements de production variables. Le code et les vidéos sont disponibles sur le site du projet.

RecherchePaper

1 source

Modèles de diffusion séquentiels pour l'apprentissage méta en contexte de la dynamique des robots

36

3arXiv cs.RO

Modèles de diffusion séquentiels pour l'apprentissage méta en contexte de la dynamique des robots

Des chercheurs ont publié sur arXiv (réf. 2604.13366) une étude comparative portant sur l'identification de systèmes robotiques par méta-apprentissage en contexte, en opposant des modèles de séquences déterministes à des approches génératives basées sur la diffusion. L'équipe reformule le problème classique de l'identification de dynamiques robotiques comme une tâche de méta-apprentissage in-context : le modèle observe une séquence de paires (commande, observation) pour inférer les paramètres dynamiques d'un robot sans re-entraînement. Deux architectures de diffusion sont introduites et évaluées face à une baseline Transformer déterministe : une diffusion par inpainting (inspirée de Diffuser), qui apprend la distribution jointe entrée-observation, et des modèles de diffusion conditionnés sur les entrées de contrôle, déclinés en versions CNN et Transformer. Les expériences sont menées à grande échelle dans des simulations randomisées couvrant des régimes en distribution et hors distribution. Ces résultats sont significatifs pour la commande basée sur modèle (model-based control), qui exige des prédictions de dynamique précises et robustes. L'étude montre que les modèles de diffusion surpassent nettement la baseline déterministe lorsque les conditions d'exécution s'écartent de la distribution d'entraînement, un scénario courant dans les déploiements industriels réels où les robots rencontrent des charges utiles variables, des surfaces inattendues ou de l'usure mécanique. La diffusion par inpainting obtient les meilleures performances globales. Un résultat clé concerne la contrainte temps réel : grâce à un échantillonnage à démarrage chaud (warm-started sampling), les modèles de diffusion parviennent à opérer dans les fenêtres temporelles exigées par les boucles de contrôle, levant ainsi un obstacle majeur à leur adoption pratique. Ce travail s'inscrit dans un courant de recherche actif qui cherche à combiner les capacités génératives des modèles de diffusion avec les exigences de robustesse et de latence du contrôle robotique. La diffusion appliquée à la planification de trajectoires et à la prédiction de dynamiques a émergé avec des travaux comme Diffuser (Janner et al., 2022) et se confronte ici à un scénario de méta-apprentissage, plus réaliste pour des robots déployés dans des environnements variables. Les concurrents directs incluent les approches probabilistes bayésiennes et les réseaux neuronaux récurrents pour l'identification en ligne. La prochaine étape naturelle sera une validation sur hardware réel, notamment pour confirmer que les gains hors distribution observés en simulation résistent au sim-to-real gap.

RecherchePaper

1 source

De la cinématique à la dynamique : apprendre à affiner des plans hybrides pour une exécution physiquement faisable

36

4arXiv cs.RO

De la cinématique à la dynamique : apprendre à affiner des plans hybrides pour une exécution physiquement faisable

Une équipe de chercheurs présente dans un préprint arXiv (2604.12474, avril 2026) une méthode d'apprentissage par renforcement (RL) conçue pour corriger les trajectoires générées par des planificateurs hybrides temporels avant exécution réelle sur un robot. Le problème central est classique : lorsqu'un robot doit traverser une séquence de régions spatiales en respectant des contraintes de délais, de fenêtres temporelles et de limites en vitesse ou accélération, les planificateurs hybrides actuels modélisent le mouvement via des dynamiques linéaires du premier ordre (cinématique pure), sans tenir compte des contraintes physiques réelles du système. Il en résulte des plans qui sont logiquement valides mais dynamiquement infaisables. Les auteurs formalisent ce problème de raffinement comme un processus de décision markovien (MDP) intégrant explicitement des contraintes analytiques du second ordre (accélération, couple) et entraînent un agent RL en espace continu pour transformer le plan initial en une trajectoire exécutable. L'intérêt pratique est direct pour les intégrateurs et les équipes robotique : le sim-to-real gap le plus coûteux n'est souvent pas dans la perception ou la préhension, mais dans le suivi de trajectoire. Un plan validé par un planificateur symbolique peut générer des couples impossibles ou des profils de vitesse non bornés, forçant les équipes terrain à retoucher les trajectoires à la main ou à surcontraindre le planificateur. La méthode proposée agit comme une couche de post-traitement apprenante qui récupère la faisabilité physique de manière fiable, sans rejeter la séquence d'actions de haut niveau, et sans nécessiter une re-planification complète. Cela positionne l'approche comme un outil de robustification entre le niveau symbolique et le contrôleur bas niveau, un segment peu adressé dans la littérature. Les planificateurs hybrides temporels comme PDDL+ ou ENHSP tentent depuis une décennie d'intégrer la dynamique continue dans la planification symbolique, avec des résultats limités dès que les modèles s'éloignent de la linéarité. Les approches concurrentes incluent le MPC (Model Predictive Control) et les méthodes de trajectory optimization (iLQR, MPPI), mais elles supposent généralement un plan discret déjà fixé ou ignorent les contraintes temporelles symboliques. La contribution ici est leur combinaison explicite via RL. Le papier reste au stade de la preuve de concept sur des scénarios de navigation structurés ; les prochaines étapes naturelles seraient la validation sur hardware avec des dynamiques plus riches (bras manipulateurs, humanoïdes) et des benchmarks comparatifs contre MPC sur des horizons longs.

RecherchePaper

1 source

Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides

À lire aussi

Modèle World-Value-Action : planification implicite pour les systèmes vision-langage-action (VLA)

Wiggle and Go! : identification du système pour la manipulation dynamique de corde sans démonstration

Modèles de diffusion séquentiels pour l'apprentissage méta en contexte de la dynamique des robots

De la cinématique à la dynamique : apprendre à affiner des plans hybrides pour une exécution physiquement faisable