Skill2Real : apprentissage de compétences à base d'agents pour la manipulation robotique en transfert simulation-réel sans entraînement supplémentaire
Des chercheurs publient sur arXiv (2610.02788) Skill2Real, un cadre de politiques « agentiques » qui apprend des compétences robotiques exécutables à travers une interface de programmation (API) partagée, puis les transfère à un robot réel en zero-shot, sans réglage fin de la politique de tâche ni mise à jour de la mémoire de compétences. L'architecture est hiérarchique : un « Cerebellum » acquiert d'abord des compétences locales de manipulation, puis un « Brain » apprend la composition au niveau de la tâche, le Cerebellum restant gelé. Un cycle Proposer-Verifier-Governor (PVG) s'appuie sur des données privilégiées de simulation pour diagnostiquer les échecs et valider les modifications, tout en gardant les compétences ancrées dans les observations publiques et la sémantique de l'API. Les chiffres annoncés : avec GPT-5.6 Sol apprenant sur LIBERO-90 et GPT-6 Astra évaluant chaque checkpoint gelé, le taux de réussite sur LIBERO-Pro Long passe de 2,0 % à 56,3 %, sans entraînement sur ce jeu. Un entraînement indépendant sur Robosuite atteint 85,1 % (Sol) et 89,4 % (Opus 5) de réussite moyenne sur sept tâches. Sur quatre tâches réelles, les compétences gelées apprises par Sol sur LIBERO-90 atteignent 78,75 % d'achèvement moyen avec Astra.
L'intérêt tient à l'approche : plutôt que d'entraîner un VLA de bout en bout et de combler l'écart sim-to-real par de la randomisation de domaine ou du fine-tuning sur données réelles, le travail fait apprendre à un LLM des programmes qui appellent une API commune. Cette couche d'abstraction absorbe en partie les différences de perception, de dynamique et d'embodiment. Les ablations donnent un signal utile : retirer le Verifier ou le Governor pendant l'entraînement réduit le succès final sur Pro Long de 17,3 et 13,3 points, ce qui suggère que la boucle de validation compte autant que le modèle. Pour les intégrateurs, cela évoque une voie où les compétences deviennent des actifs logiciels réutilisables d'un robot à l'autre. Les réserves sont nettes : quatre tâches réelles seulement, une moyenne de 78,75 % qui masque sans doute des écarts entre tâches, un résultat dépendant de modèles de fondation propriétaires, et une dépendance à une API bien conçue qui déplace une partie de la difficulté plutôt qu'elle ne la supprime. Il s'agit de résultats de laboratoire, pas d'un produit ni d'un déploiement.
Ce travail s'inscrit dans la lignée des approches « code as policies » et des agents LLM pour la robotique, qui rivalisent avec les VLA comme Pi-0 ou GR00T, entraînés sur de grands volumes de démonstrations. LIBERO et Robosuite sont des bancs d'essai standards de manipulation en simulation, et LIBERO-Pro est une variante plus exigeante visant à tester la robustesse, ce qui rend le bond de 2,0 % à 56,3 % d'autant plus notable, même s'il reste loin d'une fiabilité industrielle. L'article ne mentionne ni calendrier ni pilote industriel. Les prochaines étapes à surveiller sont des tests sur davantage de tâches et d'embodiments, une évaluation avec des modèles ouverts, et une comparaison directe avec des VLA affinés sur données réelles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




