RoboCoach : des modèles du monde comme coachs actifs pour les compétences robotiques composables
Des chercheurs présentent RoboCoach, un cadre de « coaching » piloté par un modèle du monde, destiné à améliorer des compétences robotiques réutilisables sans multiplier les démonstrations de bout en bout. Le système repose sur CoachWorld, un modèle du monde conditionné par l'action et partagé entre les compétences. Il exécute en imagination des « experts » de compétences (des adaptateurs spécialisés) dans une boucle baptisée RIDI (Route-Imagine-Diagnose-Improve). Un juge de progression consigne la première sous-tâche qui échoue. L'agrégation de ces échecs imaginés détermine quelles démonstrations de sous-tâches collecter et quels adaptateurs mettre à jour. L'évaluation couvre deux suites de simulation et deux plateformes réelles, Franka et AgileX. Avec seulement 150 démonstrations supplémentaires, le taux de succès passe de 13,3 % à 75,0 % sur Franka et de 40,0 % à 83,8 % sur AgileX. Sur 22 paires tâche-politique, le succès imaginé et le succès réel sont corrélés (rho = 0,840). Sur quatre compositions de tâches jamais vues, les experts coachés atteignent 35,0 % de succès en moyenne, contre 0 % pour une politique partagée mise à jour avec des démonstrations collectées uniformément.
L'enjeu touche au coût de la donnée, principal goulot d'étranglement de la manipulation à long horizon. Les tâches enchaînent des compétences réutilisées dans de nombreuses combinaisons, et collecter des démonstrations complètes pour chaque variante ne passe pas à l'échelle. Cibler la sous-tâche qui échoue en premier plutôt que d'élargir la collecte à l'aveugle est une réponse pragmatique pour un intégrateur qui doit amortir ses campagnes de téléopération. La corrélation de 0,840 suggère aussi qu'un modèle du monde peut servir de banc d'essai pour prioriser la collecte avant de mobiliser du matériel réel. Deux réserves s'imposent. Il s'agit d'un preprint, et 22 paires constituent un échantillon restreint. Le gain de 35,0 % sur compositions inédites reste modeste en valeur absolue : il prouve un transfert, pas une généralisation robuste. Les 0 % du témoin montrent surtout que la mise à jour uniforme ne transfère pas, ce qui dépend du protocole choisi par les auteurs.
Ce travail s'inscrit dans la montée des politiques modulaires et des modèles du monde, face aux approches VLA monolithiques entraînées de bout en bout, qui demandent des volumes de données croissants. Il prolonge les efforts d'auto-amélioration des robots, où le système décide lui-même quoi apprendre ensuite. L'article ne précise ni code ouvert ni calendrier de déploiement industriel : une page projet est annoncée, mais aucune suite commerciale ne l'est. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues, avec davantage de plateformes et de compositions, ainsi que la fiabilité du juge de progression, dont dépend tout le diagnostic. Aucun acteur français ou européen n'est cité dans ces travaux.




