Aller au contenu principal
RecherchearXiv cs.RO 

RoboCoach : des modèles du monde comme coachs actifs pour les compétences robotiques composables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent RoboCoach, un cadre de « coaching » piloté par un modèle du monde, destiné à améliorer des compétences robotiques réutilisables sans multiplier les démonstrations de bout en bout. Le système repose sur CoachWorld, un modèle du monde conditionné par l'action et partagé entre les compétences. Il exécute en imagination des « experts » de compétences (des adaptateurs spécialisés) dans une boucle baptisée RIDI (Route-Imagine-Diagnose-Improve). Un juge de progression consigne la première sous-tâche qui échoue. L'agrégation de ces échecs imaginés détermine quelles démonstrations de sous-tâches collecter et quels adaptateurs mettre à jour. L'évaluation couvre deux suites de simulation et deux plateformes réelles, Franka et AgileX. Avec seulement 150 démonstrations supplémentaires, le taux de succès passe de 13,3 % à 75,0 % sur Franka et de 40,0 % à 83,8 % sur AgileX. Sur 22 paires tâche-politique, le succès imaginé et le succès réel sont corrélés (rho = 0,840). Sur quatre compositions de tâches jamais vues, les experts coachés atteignent 35,0 % de succès en moyenne, contre 0 % pour une politique partagée mise à jour avec des démonstrations collectées uniformément.

L'enjeu touche au coût de la donnée, principal goulot d'étranglement de la manipulation à long horizon. Les tâches enchaînent des compétences réutilisées dans de nombreuses combinaisons, et collecter des démonstrations complètes pour chaque variante ne passe pas à l'échelle. Cibler la sous-tâche qui échoue en premier plutôt que d'élargir la collecte à l'aveugle est une réponse pragmatique pour un intégrateur qui doit amortir ses campagnes de téléopération. La corrélation de 0,840 suggère aussi qu'un modèle du monde peut servir de banc d'essai pour prioriser la collecte avant de mobiliser du matériel réel. Deux réserves s'imposent. Il s'agit d'un preprint, et 22 paires constituent un échantillon restreint. Le gain de 35,0 % sur compositions inédites reste modeste en valeur absolue : il prouve un transfert, pas une généralisation robuste. Les 0 % du témoin montrent surtout que la mise à jour uniforme ne transfère pas, ce qui dépend du protocole choisi par les auteurs.

Ce travail s'inscrit dans la montée des politiques modulaires et des modèles du monde, face aux approches VLA monolithiques entraînées de bout en bout, qui demandent des volumes de données croissants. Il prolonge les efforts d'auto-amélioration des robots, où le système décide lui-même quoi apprendre ensuite. L'article ne précise ni code ouvert ni calendrier de déploiement industriel : une page projet est annoncée, mais aucune suite commerciale ne l'est. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues, avec davantage de plateformes et de compositions, ainsi que la fiabilité du juge de progression, dont dépend tout le diagnostic. Aucun acteur français ou européen n'est cité dans ces travaux.

À lire aussi

Revue complète des modèles du monde pour l'apprentissage robotique
1arXiv cs.RO 

Revue complète des modèles du monde pour l'apprentissage robotique

Un groupe de chercheurs a publié début mai 2026 une revue systématique sur les modèles de monde appliqués à l'apprentissage robotique (arXiv:2605.00080). Ces modèles sont des représentations prédictives qui modélisent l'évolution d'un environnement en réponse aux actions d'un agent. Utilisés dans six fonctions distinctes, policy learning, planification, simulation, évaluation, génération de données et entraînement à l'échelle fondation, ils sont devenus un composant central des architectures robotiques modernes. Le survey couvre les grandes familles d'architectures, leurs rôles fonctionnels et leurs applications dans l'embodied AI, en s'étendant à la navigation mobile et à la conduite autonome. Les auteurs inventorient également les benchmarks et protocoles d'évaluation disponibles dans le domaine, et maintiennent un dépôt GitHub mis à jour en continu pour intégrer les travaux émergents. L'intérêt de cette synthèse réside dans la fragmentation actuelle du domaine : les architectures de modèles de monde se développent en silos, reinforcement learning, génération vidéo, VLA (Vision-Language-Action models), avec peu de recoupement méthodologique. Le survey clarifie comment ces modèles s'articulent avec les politiques robotiques, comment ils servent de simulateurs appris pour le RL, et comment les modèles de monde vidéo ont évolué de la génération par imagination vers des formulations contrôlables à l'échelle fondation. Pour les équipes R&D et les intégrateurs industriels, cette cartographie facilite le choix architectural et réduit le risque de duplication des efforts. L'accélération récente du domaine est en partie portée par la montée en puissance des foundation models et de la génération vidéo large-scale depuis 2023. Les modèles de monde en robotique s'enracinent dans les travaux de Schmidhuber dans les années 1990 et ont connu un regain majeur avec DreamerV3 (Google DeepMind, 2023), UniSim, et les VLA récents intégrant une prédiction d'état futur comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les acteurs dominants restent américains et chinois, DeepMind, NVIDIA, Physical Intelligence, Figure AI, avec des contributions académiques majeures de Stanford, MIT et Berkeley. En Europe, les contributions restent moins visibles à l'échelle internationale, bien que des acteurs comme Pollen Robotics (France) et l'INRIA travaillent sur des approches connexes. Le principal défi identifié est de combler le sim-to-real gap via des modèles suffisamment fidèles pour substituer partiellement les environnements physiques dans la boucle d'entraînement.

UEPollen Robotics et l'INRIA sont mentionnés comme acteurs connexes mais restent en retrait international ; cette cartographie peut aider les équipes européennes à identifier les lacunes à combler face à la domination américaine et chinoise.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
2arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique
3arXiv cs.RO 

IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique

Un article publié sur arXiv (2607.00836) dresse un état des lieux conceptuel des "world models" utilisés en robotique et en simulation générative, un terme dont le périmètre varie fortement selon les communautés de recherche. Les auteurs proposent une définition unifiée : un modèle du monde est un système conditionné par l'action qui prédit l'évolution future des observations ou des états pertinents pour une tâche donnée. Ils distinguent deux grandes familles : les modèles dans l'espace des observations, qui prédisent des images ou vidéos brutes, et les modèles dans l'espace des états, qui travaillent sur des représentations compactes. Chaque approche est comparée selon quatre critères : fidélité visuelle, structuration spatiale, interprétabilité physique et facilité d'usage pour le contrôle. Le papier introduit ensuite les "world action models", qui relient ces prédictions du futur à des actions robotiques exécutables, avec quatre paradigmes identifiés : imaginer puis exécuter, prédiction d'action conditionnée par des features vidéo, modélisation conjointe vidéo-action, et prédiction vidéo auxiliaire pour l'apprentissage de politiques. Cette clarification terminologique a une portée pratique pour les équipes qui développent des politiques robotiques : elle aide à choisir entre un modèle générateur de pixels, coûteux en calcul mais riche visuellement, et un modèle d'état plus léger, plus proche du contrôle temps réel mais moins interprétable. Elle formalise aussi un débat de fond du secteur : les modèles de génération vidéo produisent des démonstrations spectaculaires, mais leur utilité réelle pour piloter un bras ou un humanoïde reste à prouver, faute de garanties physiques strictes, ce qui rejoint les critiques récurrentes sur l'écart entre démo et déploiement réel. En distinguant explicitement l'approche "imaginer puis exécuter" des méthodes qui apprennent directement une politique conjointe vidéo-action, le tutoriel donne aux intégrateurs une grille de lecture pour évaluer les annonces commerciales selon ce qu'elles modélisent vraiment, plutôt que sur la seule qualité de leurs vidéos. Ce travail arrive alors que les world models occupent une place croissante dans la course aux modèles vision-langage-action, portée par des systèmes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui combinent tous, à des degrés divers, prédiction du futur et génération d'actions. Sans analyser directement ces produits commerciaux, la taxonomie proposée offre un cadre académique pour resituer ces systèmes les uns par rapport aux autres, à un moment où la recherche universitaire tente de structurer conceptuellement un domaine dont la vitesse de publication industrielle a largement dépassé la théorie.

RecherchePaper
1 source
Modèle d'action ancré : l'ancrage 3D comme fondation pour la robotique
4arXiv cs.RO 

Modèle d'action ancré : l'ancrage 3D comme fondation pour la robotique

Une équipe a publié le 22 septembre 2026 sur arXiv (2609.23863) les Grounded Action Models (GAM), une famille de modèles de fondation robotique ancrant explicitement en 3D la perception des objets à manipuler, là où les modèles vision-langage-action (VLA) et monde-action (WAM) actuels s'appuient sur le langage ou la génération vidéo sans lien direct avec la géométrie de la scène. GAM convertit des instructions en langage, points ou boîtes englobantes en une représentation centrée objet, dont la géométrie et l'historique d'état du robot sont fusionnés par un transformeur multi-flux pour prédire des séquences d'actions. Sur RoboTwin 2.0 (50 tâches), il atteint 55,3% de réussite contre 52,0% pour Spatial Forcing, et 47,6% sous randomisation de scène contre 30,4% pour Abot-M0. Sur LIBERO-PRO, il obtient 61% contre 53% pour π0.5 de Physical Intelligence. Sur un bras bimanuel YAM réel, il conserve 17 réussites sur 20 sous décalage visuel contre 4/20 pour π0.5, et couplé à un planificateur Molmo2 sur un bras Franka, il atteint 64,7% de complétion en distribution et 49,8% hors distribution sur des tâches longues. Ce travail cible un angle mort des VLA actuels, qui apprennent implicitement, à partir de démonstrations, quels objets compter et où ils se trouvent, sans contrainte géométrique explicite, ce qui les fragilise dès qu'un objet est déplacé ou que la scène change. En forçant cet ancrage 3D en amont de la politique d'action, GAM réduit l'écart entre démonstrations contrôlées et déploiement réel, un enjeu central pour les intégrateurs qui veulent sortir les bras manipulateurs des bancs de test. Sa capacité à servir de contrôleur bas niveau sous un planificateur haut niveau ouvre la voie à des tâches longues et dépendantes du contexte, un registre encore peu couvert aujourd'hui. GAM s'inscrit dans une lignée de travaux visant à corriger les VLA de type π0/π0.5 de Physical Intelligence, critiqués pour leur apprentissage implicite de la géométrie de scène, et se positionne explicitement face à Spatial Forcing, Abot-M0 et π_0.5 comme lignes de base directes. Aucun acteur industriel, date de déploiement commercial ni partenaire français ou européen n'est mentionné: il s'agit d'une publication arXiv non encore revue par les pairs, testée en simulation et sur deux plateformes robotiques de laboratoire. Les suites logiques, non détaillées dans le résumé, seraient l'extension à d'autres plateformes matérielles et une validation indépendante des chiffres avancés.

RecherchePaper
1 source