Aller au contenu principal
RecherchearXiv cs.RO 

Skill2Real : apprentissage de compétences à base d'agents pour la manipulation robotique en transfert simulation-réel sans entraînement supplémentaire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02788) Skill2Real, un cadre de politiques « agentiques » qui apprend des compétences robotiques exécutables à travers une interface de programmation (API) partagée, puis les transfère à un robot réel en zero-shot, sans réglage fin de la politique de tâche ni mise à jour de la mémoire de compétences. L'architecture est hiérarchique : un « Cerebellum » acquiert d'abord des compétences locales de manipulation, puis un « Brain » apprend la composition au niveau de la tâche, le Cerebellum restant gelé. Un cycle Proposer-Verifier-Governor (PVG) s'appuie sur des données privilégiées de simulation pour diagnostiquer les échecs et valider les modifications, tout en gardant les compétences ancrées dans les observations publiques et la sémantique de l'API. Les chiffres annoncés : avec GPT-5.6 Sol apprenant sur LIBERO-90 et GPT-6 Astra évaluant chaque checkpoint gelé, le taux de réussite sur LIBERO-Pro Long passe de 2,0 % à 56,3 %, sans entraînement sur ce jeu. Un entraînement indépendant sur Robosuite atteint 85,1 % (Sol) et 89,4 % (Opus 5) de réussite moyenne sur sept tâches. Sur quatre tâches réelles, les compétences gelées apprises par Sol sur LIBERO-90 atteignent 78,75 % d'achèvement moyen avec Astra.

L'intérêt tient à l'approche : plutôt que d'entraîner un VLA de bout en bout et de combler l'écart sim-to-real par de la randomisation de domaine ou du fine-tuning sur données réelles, le travail fait apprendre à un LLM des programmes qui appellent une API commune. Cette couche d'abstraction absorbe en partie les différences de perception, de dynamique et d'embodiment. Les ablations donnent un signal utile : retirer le Verifier ou le Governor pendant l'entraînement réduit le succès final sur Pro Long de 17,3 et 13,3 points, ce qui suggère que la boucle de validation compte autant que le modèle. Pour les intégrateurs, cela évoque une voie où les compétences deviennent des actifs logiciels réutilisables d'un robot à l'autre. Les réserves sont nettes : quatre tâches réelles seulement, une moyenne de 78,75 % qui masque sans doute des écarts entre tâches, un résultat dépendant de modèles de fondation propriétaires, et une dépendance à une API bien conçue qui déplace une partie de la difficulté plutôt qu'elle ne la supprime. Il s'agit de résultats de laboratoire, pas d'un produit ni d'un déploiement.

Ce travail s'inscrit dans la lignée des approches « code as policies » et des agents LLM pour la robotique, qui rivalisent avec les VLA comme Pi-0 ou GR00T, entraînés sur de grands volumes de démonstrations. LIBERO et Robosuite sont des bancs d'essai standards de manipulation en simulation, et LIBERO-Pro est une variante plus exigeante visant à tester la robustesse, ce qui rend le bond de 2,0 % à 56,3 % d'autant plus notable, même s'il reste loin d'une fiabilité industrielle. L'article ne mentionne ni calendrier ni pilote industriel. Les prochaines étapes à surveiller sont des tests sur davantage de tâches et d'embodiments, une évaluation avec des modèles ouverts, et une comparaison directe avec des VLA affinés sur données réelles.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Planification de mouvements précis pour la manipulation robotique par apprentissage par transfert sans données d'entraînement
1arXiv cs.RO 

Planification de mouvements précis pour la manipulation robotique par apprentissage par transfert sans données d'entraînement

Des chercheurs ont publié sur arXiv (arXiv:2606.06041) un framework baptisé iCEM+TL, qui combine la méthode évolutionnaire iCEM (improved Cross-Entropy Method) avec du Transfer Learning pour améliorer la planification de mouvement bas-niveau en robotique de manipulation. L'approche transfère directement les paramètres-clés d'iCEM appris sur des tâches simples vers des tâches plus complexes -- empilage d'objets, glissement, placement en étagère -- sans réentraîner depuis zéro. Complétée par une refonte des fonctions de récompense (Reward Redesign) via décomposition de tâche pour les scénarios d'empilage et de placement en étagère, la méthode atteint des gains de taux de succès allant jusqu'à 23 % en simulation. Elle a ensuite été validée sur un robot réel Franka Emika Panda dans un scénario d'empilage, confirmant la transférabilité sim-to-real de l'approche. L'intérêt principal réside dans l'efficacité d'échantillonnage : iCEM+TL contourne le besoin de longues phases d'entraînement en réutilisant explicitement la connaissance déjà acquise sur des tâches amont. Pour les intégrateurs industriels ou les équipes R&D robotique, cela signifie qu'ajouter une nouvelle tâche de manipulation à un bras existant ne nécessite pas un réentraînement complet -- un gain direct en temps et en coût de déploiement. Le fait que le transfert soit qualifié de "zero-shot" dans le titre mérite toutefois une nuance : il s'agit ici d'un transfert de paramètres entre tâches proches dans un même domaine, et non d'une généralisation à des environnements radicalement différents. Les résultats restent majoritairement issus de simulation, avec une validation robotique limitée à un seul scénario d'empilage -- la robustesse à l'échelle industrielle reste à établir. iCEM est un algorithme de planification en temps réel apparu comme alternative légère aux méthodes d'apprentissage par renforcement profond, notamment pour la manipulation sur bras sériels. Le Franka Emika Panda (7 DOF) est devenu un banc de test standard de la communauté académique, utilisé par des dizaines d'équipes dans le monde. Dans ce paysage, iCEM+TL se positionne en dehors des approches VLA (Vision-Language-Action) comme pi0 de Physical Intelligence ou des policies à diffusion qui dominent actuellement les benchmarks de référence tels que RLBench. La suite naturelle serait de tester le framework sur des tâches à horizon plus long, sur d'autres morphologies de robots, et de comparer formellement les gains de temps d'entraînement face aux baselines RL modernes.

RecherchePaper
1 source
Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire
2arXiv cs.RO 

Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire

Une équipe de recherche a publié le 11 août 2026 sur arXiv (référence 2608.09410) un article intitulé "Skills in Weights, Memory in Code", présentant HyMeS, un framework hybride destiné à la manipulation robotique dépendant de la mémoire à long terme. Le système associe une politique vision-langage-action (VLA) markovienne, qui apprend les compétences motrices de bas niveau par imitation learning basée sur le gradient, à un agent de codage chargé de la gestion de la mémoire de haut niveau. Cet agent apprend par heuristique, en mettant à jour de façon itérative un système de règles exécutables à partir des retours d'essais (rollouts). Une vérification multimodale de l'achèvement des étapes, combinant signaux proprioceptifs et jugements d'un modèle vision-langage sur plusieurs images, permet de rafraîchir la mémoire en boucle fermée. Sur le benchmark RoboMemArena, HyMeS fait grimper le taux de succès cumulé moyen de 52,5% à 66,2% et le taux de succès par tâche de 41,3% à 60,1% par rapport au modèle de référence pi0.5, tout en dépassant le système concurrent PrediMem de 4,5 points en succès cumulé et 14,5 points en succès par tâche. L'enjeu dépasse la simple performance chiffrée: la plupart des politiques VLA actuelles génèrent chaque action à partir de l'observation courante ou d'un historique court et fixe, ce qui les rend inadaptées aux tâches non markoviennes où le robot doit se souvenir d'informations glanées bien plus tôt dans la séquence. En séparant les compétences motrices, apprises par imitation et figées dans les poids du réseau, de la logique de mémoire, gérée en code exécutable et adaptable sans nouvelles démonstrations, HyMeS promet une généralisation compositionnelle plus économe en données: seules les compétences motrices réutilisables nécessitent des démonstrations, pas chaque configuration de tâche dépendante de l'historique. Pour les intégrateurs et laboratoires travaillant sur des tâches industrielles multi-étapes (tri, assemblage séquentiel), c'est un argument direct contre le coût prohibitif de collecte de données propre aux approches VLA de bout en bout. Le travail s'inscrit dans la lignée des modèles VLA généralistes tels que pi0.5 (Physical Intelligence), utilisé ici comme référence, et se positionne face à d'autres approches de mémoire augmentée comme PrediMem. Il s'agit à ce stade d'un préprint arXiv validé uniquement sur le benchmark RoboMemArena, sans validation annoncée sur robot physique ni pilote industriel.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
3arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
Basse fidélité suffit : transfert simulation-réel sans apprentissage préalable pour le contrôle d'un poisson robotique
4arXiv cs.RO 

Basse fidélité suffit : transfert simulation-réel sans apprentissage préalable pour le contrôle d'un poisson robotique

Des chercheurs montrent qu'un simulateur volontairement sommaire suffit pour entraîner le contrôleur d'un poisson robotique souple, qui fonctionne ensuite sur le matériel sans aucun réglage. La plateforme est un poisson mou à moteur unique, actionné par tendon et sous-actionné. Son modèle de fluide est quasi statique et sans mémoire : il ne modélise ni sillage ni historique de masse ajoutée. La politique apprise n'observe que ce que le matériel peut mesurer. Elle ne commande pas la queue directement. Elle passe par un générateur de trajectoire rythmique à bande limitée. Le simulateur est calé en deux étapes d'identification indépendantes, l'une pour la dynamique de la queue, l'autre pour le modèle de fluide sans état. Déployée telle quelle dans un bassin extérieur, une seule politique en boucle fermée atteint des cibles, rejette des perturbations, et acquiert puis suit des cibles hors distribution. L'étude est publiée sur arXiv (2609.36993). Elle ne donne ni vitesses, ni taux de réussite chiffrés, ni nombre d'essais dans son résumé. Le résultat va à l'encontre de l'idée courante selon laquelle un bon transfert simulation-réalité exige une simulation de plus en plus fidèle, donc de plus en plus coûteuse, en particulier pour les fluides. Les auteurs attribuent le transfert à une contrainte plutôt qu'à la fidélité : le générateur ne peut pas sortir de la bande de fréquences sur laquelle le fluide a été identifié, si bien que la politique ne rencontre jamais de régimes où le modèle simplifié serait faux. Une partie de la physique se trouve ainsi dans la structure du contrôleur et non dans le simulateur. Pour les intégrateurs et les équipes de R&D en robotique sous-marine ou souple, cela pourrait réduire le coût d'entraînement, mais rien ne dit encore que l'approche vaut hors de cette bande de fonctionnement. Un seul robot a été testé, dans un bassin extérieur, et non en milieu ouvert avec courants, vagues ou turbulences. Le résumé ne compare pas non plus la méthode à des simulateurs à haute fidélité ou à la randomisation de domaine. Ce travail s'inscrit dans une limite connue de la robotique sous-marine : les capacités des contrôleurs freinent les tâches complexes. Les poissons souples sont difficiles à modéliser, car l'interaction fluide-structure est coûteuse à simuler. Les arbitrages classiques opposent la précision des solveurs CFD (mécanique des fluides numérique) à la vitesse d'un entraînement par apprentissage par renforcement. Les auteurs posent en conclusion la question de la part de physique qui peut résider dans le contrôleur plutôt que dans le simulateur. Il s'agit d'un résultat de laboratoire, pas d'un produit ni d'un déploiement commercial, et le résumé n'annonce ni pilote ni calendrier. Les suites logiques seraient de tester d'autres morphologies, des bandes de fréquences plus larges et des conditions d'eau moins contrôlées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source