Aller au contenu principal
RecherchearXiv cs.RO 

FutureWorlds : apprendre des modèles du monde robotiques à partir de futurs alternatifs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient FutureWorlds, un cadre d'apprentissage de modèles du monde robotiques (world models) qui prédisent la scène future en fonction des actions du robot. Il repose sur un modèle autorégressif discret multimodal. Pendant l'apprentissage par renforcement, il applique une diverse beam search pour produire plusieurs futurs candidats qui équilibrent confiance et diversité. Chaque candidat dispose d'une mémoire bornée qui conserve les états de la scène, de sorte que la génération et le scoring de la politique s'appuient sur le même historique. Les auteurs proposent aussi MemSPO (Memory-Conditioned Search-Guided Policy Optimization). Cette méthode convertit les récompenses de trajectoires vidéo en avantages relatifs au sein d'un groupe de candidats, puis s'en sert pour optimiser le modèle. Sur RT-1, BridgeV2 et RoboCasa, la LPIPS (métrique de distance perceptuelle) à 32 images baisse de 14,78 %, 20,84 % et 9,12 % par rapport à la meilleure référence de chaque jeu de données. Selon les auteurs, 200 mises à jour MemSPO suffisent pour améliorer encore la qualité et prolonger la prédiction au-delà de l'horizon d'entraînement. Le code et la page projet sont publiés sur GitHub.

L'enjeu tient à la manière dont on exploite les prédictions d'un world model. Prédire un futur plausible ne suffit pas. Il faut comparer plusieurs futurs pour en tirer un signal d'apprentissage. Quand les candidats se ressemblent, la comparaison apporte peu d'information. Quand ils divergent, chacun exige un historique propre, ce qui fait grossir le coût de mémoire et le risque d'incohérence. En traitant ces deux contraintes ensemble, FutureWorlds vise des simulateurs appris plus fiables pour évaluer des politiques VLA (vision-langage-action) ou pour générer des données d'entraînement. Les ablations sur la mémoire, l'analyse de sensibilité au décodage et l'évaluation par flux optique indiquent que le gain dépasse l'aspect visuel, avec un mouvement mieux prédit et des états d'objets plus cohérents. Les limites sont nettes : les résultats sont des métriques de génération vidéo hors ligne, sans test sur robot réel. Les gains sont mesurés contre des références choisies par les auteurs. Rien n'indique non plus que la qualité de prédiction se traduise en meilleures politiques de contrôle.

Le travail s'inscrit dans la montée des world models pour la robotique. RT-1, BridgeV2 et RoboCasa sont des corpus de manipulation devenus des bancs d'essai courants pour ces modèles. Les approches concurrentes reposent surtout sur la diffusion vidéo ou sur des modèles autorégressifs entraînés par maximum de vraisemblance. Les auteurs misent plutôt sur le post-entraînement par renforcement, à l'image de ce qui a réussi pour les grands modèles de langage. La suite logique consisterait à utiliser ces world models comme simulateurs pour entraîner des politiques, puis à valider sur matériel réel. Cela reste à démontrer. Cette publication est une préversion arXiv (v1) qui n'a pas encore été relue par des pairs. Aucun acteur européen n'y est mentionné.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

LD4WAM : apprendre les dynamiques latentes à partir de vidéos humaines pour des modèles d'action du monde
1arXiv cs.RO 

LD4WAM : apprendre les dynamiques latentes à partir de vidéos humaines pour des modèles d'action du monde

Des chercheurs ont publié en août 2026 sur arXiv un article présentant LD4WAM, une méthode pour entraîner des World Action Models à partir de vidéos humaines plutôt que de données de téléopération, coûteuses à collecter. Le système associe un Latent Dynamics Model, entraîné par reconstruction sémantique et alignement sur le mouvement réel, à un World Dynamics Action Model en mixture-of-transformers, qui génère des vidéos futures puis en extrait, via des requêtes apprenables, une dynamique latente conditionnant les actions du robot. Pré-entraîné sur un jeu de données unifié de plus de 5 000 heures de vidéos humaines et robotiques, le modèle affiche de bons résultats dans le simulateur RoboTwin et sur des robots réels équipés de pinces et de mains dexterisées, avec une généralisation à des objets et arrière-plans inédits. L'enjeu dépasse la prouesse technique. La vidéo humaine est bien plus abondante et moins chère à collecter que les démonstrations téléopérées, mais son exploitation butait sur un dilemme entre prédiction vidéo pixel par pixel, riche mais non actionnable, et retargeting du mouvement vers le squelette du robot, actionnable mais marqué par un fossé visuel entre corps humain et robot. En proposant une dynamique latente alignée sur le mouvement, agnostique à l'embodiment, LD4WAM cherche à combler ce fossé, ce qui pourrait réduire la dépendance des laboratoires aux campagnes de téléopération pour entraîner des politiques de manipulation, un des principaux goulots d'étranglement du passage à l'échelle des modèles vision-langage-action. Ce travail s'inscrit dans une vague de recherche plus large sur les modèles de monde en robotique, aux côtés d'efforts comme GR00T de NVIDIA, pi-0 de Physical Intelligence ou Helix de Figure, qui explorent aussi l'exploitation de données hétérogènes pour des politiques généralistes. LD4WAM se positionne explicitement contre les deux paradigmes qui l'ont précédé, prédiction vidéo pure et retargeting de mouvement. Il s'agit pour l'instant d'un article déposé sur arXiv, non encore relu par les pairs, sans code publié ni partenariat industriel annoncé, et les démonstrations réelles restent limitées au laboratoire, sans détail sur le taux de réussite.

RecherchePaper
1 source
Revue complète des modèles du monde pour l'apprentissage robotique
2arXiv cs.RO 

Revue complète des modèles du monde pour l'apprentissage robotique

Un groupe de chercheurs a publié début mai 2026 une revue systématique sur les modèles de monde appliqués à l'apprentissage robotique (arXiv:2605.00080). Ces modèles sont des représentations prédictives qui modélisent l'évolution d'un environnement en réponse aux actions d'un agent. Utilisés dans six fonctions distinctes, policy learning, planification, simulation, évaluation, génération de données et entraînement à l'échelle fondation, ils sont devenus un composant central des architectures robotiques modernes. Le survey couvre les grandes familles d'architectures, leurs rôles fonctionnels et leurs applications dans l'embodied AI, en s'étendant à la navigation mobile et à la conduite autonome. Les auteurs inventorient également les benchmarks et protocoles d'évaluation disponibles dans le domaine, et maintiennent un dépôt GitHub mis à jour en continu pour intégrer les travaux émergents. L'intérêt de cette synthèse réside dans la fragmentation actuelle du domaine : les architectures de modèles de monde se développent en silos, reinforcement learning, génération vidéo, VLA (Vision-Language-Action models), avec peu de recoupement méthodologique. Le survey clarifie comment ces modèles s'articulent avec les politiques robotiques, comment ils servent de simulateurs appris pour le RL, et comment les modèles de monde vidéo ont évolué de la génération par imagination vers des formulations contrôlables à l'échelle fondation. Pour les équipes R&D et les intégrateurs industriels, cette cartographie facilite le choix architectural et réduit le risque de duplication des efforts. L'accélération récente du domaine est en partie portée par la montée en puissance des foundation models et de la génération vidéo large-scale depuis 2023. Les modèles de monde en robotique s'enracinent dans les travaux de Schmidhuber dans les années 1990 et ont connu un regain majeur avec DreamerV3 (Google DeepMind, 2023), UniSim, et les VLA récents intégrant une prédiction d'état futur comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les acteurs dominants restent américains et chinois, DeepMind, NVIDIA, Physical Intelligence, Figure AI, avec des contributions académiques majeures de Stanford, MIT et Berkeley. En Europe, les contributions restent moins visibles à l'échelle internationale, bien que des acteurs comme Pollen Robotics (France) et l'INRIA travaillent sur des approches connexes. Le principal défi identifié est de combler le sim-to-real gap via des modèles suffisamment fidèles pour substituer partiellement les environnements physiques dans la boucle d'entraînement.

UEPollen Robotics et l'INRIA sont mentionnés comme acteurs connexes mais restent en retrait international ; cette cartographie peut aider les équipes européennes à identifier les lacunes à combler face à la domination américaine et chinoise.

RecherchePaper
1 source
RoboCoach : des modèles du monde comme coachs actifs pour les compétences robotiques composables
3arXiv cs.RO 

RoboCoach : des modèles du monde comme coachs actifs pour les compétences robotiques composables

Des chercheurs présentent RoboCoach, un cadre de « coaching » piloté par un modèle du monde, destiné à améliorer des compétences robotiques réutilisables sans multiplier les démonstrations de bout en bout. Le système repose sur CoachWorld, un modèle du monde conditionné par l'action et partagé entre les compétences. Il exécute en imagination des « experts » de compétences (des adaptateurs spécialisés) dans une boucle baptisée RIDI (Route-Imagine-Diagnose-Improve). Un juge de progression consigne la première sous-tâche qui échoue. L'agrégation de ces échecs imaginés détermine quelles démonstrations de sous-tâches collecter et quels adaptateurs mettre à jour. L'évaluation couvre deux suites de simulation et deux plateformes réelles, Franka et AgileX. Avec seulement 150 démonstrations supplémentaires, le taux de succès passe de 13,3 % à 75,0 % sur Franka et de 40,0 % à 83,8 % sur AgileX. Sur 22 paires tâche-politique, le succès imaginé et le succès réel sont corrélés (rho = 0,840). Sur quatre compositions de tâches jamais vues, les experts coachés atteignent 35,0 % de succès en moyenne, contre 0 % pour une politique partagée mise à jour avec des démonstrations collectées uniformément. L'enjeu touche au coût de la donnée, principal goulot d'étranglement de la manipulation à long horizon. Les tâches enchaînent des compétences réutilisées dans de nombreuses combinaisons, et collecter des démonstrations complètes pour chaque variante ne passe pas à l'échelle. Cibler la sous-tâche qui échoue en premier plutôt que d'élargir la collecte à l'aveugle est une réponse pragmatique pour un intégrateur qui doit amortir ses campagnes de téléopération. La corrélation de 0,840 suggère aussi qu'un modèle du monde peut servir de banc d'essai pour prioriser la collecte avant de mobiliser du matériel réel. Deux réserves s'imposent. Il s'agit d'un preprint, et 22 paires constituent un échantillon restreint. Le gain de 35,0 % sur compositions inédites reste modeste en valeur absolue : il prouve un transfert, pas une généralisation robuste. Les 0 % du témoin montrent surtout que la mise à jour uniforme ne transfère pas, ce qui dépend du protocole choisi par les auteurs. Ce travail s'inscrit dans la montée des politiques modulaires et des modèles du monde, face aux approches VLA monolithiques entraînées de bout en bout, qui demandent des volumes de données croissants. Il prolonge les efforts d'auto-amélioration des robots, où le système décide lui-même quoi apprendre ensuite. L'article ne précise ni code ouvert ni calendrier de déploiement industriel : une page projet est annoncée, mais aucune suite commerciale ne l'est. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues, avec davantage de plateformes et de compositions, ainsi que la fiabilité du juge de progression, dont dépend tout le diagnostic. Aucun acteur français ou européen n'est cité dans ces travaux.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
4arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source