Aller au contenu principal
ASPIRE : découverte de compétences à base d'agents pour la robotique
RecherchearXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K.

Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu.

Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

Dans nos dossiers

À lire aussi

SkillWeaver : exploration à base d'agents de compétences d'interaction neuronales pour la génération de données robotiques à grande échelle
1arXiv cs.RO 

SkillWeaver : exploration à base d'agents de compétences d'interaction neuronales pour la génération de données robotiques à grande échelle

SkillWeaver, un framework publié sur arXiv (2609.36171), propose de générer automatiquement des données robotiques en simulation grâce à un agent de raisonnement. Le système repose sur des « Neural Interaction Skills » (NIS), des politiques paramétrables, réutilisables et en boucle fermée, entraînées par apprentissage par renforcement pour la manipulation riche en contacts. Étant donné une tâche et un environnement simulé, un agent VLM (modèle vision-langage) décide de la prochaine action, invoque et paramètre une NIS, observe le résultat, puis produit des étapes de vérification, de réflexion et de mémoire. L'exploration prend la forme d'une recherche arborescente guidée par un vérificateur. Le système a généré 39,1 K démonstrations sur 14,1 K scènes, ensuite distillées en politiques visuomotrices. Il s'agit d'un travail de recherche, sans produit ni déploiement industriel associé. L'enjeu porte sur le goulot d'étranglement de la donnée. La téléopération reste coûteuse et difficilement extensible à des environnements variés ou à des tâches longues. Les pipelines de simulation actuels dépendent souvent de contrôleurs en boucle ouverte, de séquences de compétences scriptées ou de programmes propres à chaque tâche, ce qui limite leur généralité. SkillWeaver déplace la logique : le savoir-faire physique est encapsulé dans des primitives apprises, et l'agent découvre lui-même les enchaînements gagnants. Les auteurs affirment une meilleure généralisation à de nouveaux objets, configurations spatiales, tâches et environnements, ainsi qu'un transfert sim-to-sim et sim-to-real en zéro ou few-shot. Ces résultats viennent du résumé de l'article. Le résumé ne donne aucun taux de réussite, aucun modèle de référence ni aucun protocole. Le volume de manipulation réelle testé est aussi inconnu, alors que c'est là que se joue l'écart entre démonstration et réalité. La revendication d'une alternative « scalable » reste donc à confirmer par les tableaux détaillés. Le travail s'inscrit dans la recherche sur la génération de données synthétiques pour les modèles VLA (vision-langage-action), qui alimentent aujourd'hui les efforts autour de Pi-0, GR00T ou Helix. Elle vise à réduire la dépendance à la collecte humaine. Les approches concurrentes combinent LLM et code généré, ou augmentent un petit nombre de démonstrations humaines en simulation. L'originalité ici est de placer des politiques RL fermées, et non du code ou des trajectoires scriptées, comme briques de l'exploration. La suite dépendra de la publication du code et des données, de la reproduction par d'autres laboratoires et de la mesure du coût de calcul de la recherche arborescente. Aucun acteur français ou européen n'est cité dans le résumé.

RecherchePaper
1 source
EmbodiedSWE : agents de codage pour la robotique dextre à long horizon
2arXiv cs.RO 

EmbodiedSWE : agents de codage pour la robotique dextre à long horizon

Une équipe de recherche présente EmbodiedSWE, un système qui exploite des agents de codage pour résoudre des tâches de robotique dextre à long horizon, avant de transformer leurs solutions en données d'entraînement pour des politiques robotiques générales. Les auteurs introduisent EmbodiedSWE-Bench, un benchmark de simulation couvrant la manipulation à contact riche, les objets déformables et des tâches longues exigeant jusqu'à trente minutes d'interaction continue. Les agents de codage de pointe testés résolvent ces tâches et transfèrent leurs solutions d'une tâche à l'autre, voire d'un robot à un autre, au prix de nombreuses itérations et d'une forte spécialisation. EmbodiedSWE-Gen démultiplie ensuite une solution unique en de nombreuses trajectoires diversifiées pour entraîner un modèle vision-langage-action (VLA), qui, entraîné uniquement sur ces démonstrations simulées, exécute avec succès une tâche longue sur un robot réel, sans donnée de téléopération humaine. Ce résultat s'attaque au principal goulot d'étranglement de l'apprentissage robotique : la collecte de démonstrations, aujourd'hui dominée par la téléopération humaine, lente et coûteuse. En montrant qu'un agent de codage capable d'itérer en simulation peut se substituer à l'opérateur humain pour produire des trajectoires exploitables, l'étude ouvre une piste de supervision scalable pour les politiques VLA, la même famille de modèles que des systèmes connus du secteur comme GR00T N2, Pi-0 ou Helix. Pour les intégrateurs et décideurs industriels, l'enjeu est de réduire le coût et le délai nécessaires pour doter un robot de nouvelles compétences sans dépendre de flottes dédiées à la collecte de données. Le transfert réussi vers un robot réel, même limité à une seule tâche démontrée, suggère que l'écart sim-to-real peut être comblé par une diversification algorithmique des trajectoires plutôt que par un volume massif de données réelles. L'approche s'inscrit dans la tendance qui consiste à détourner les agents de codage, conçus pour l'ingénierie logicielle, vers des problèmes de contrôle physique, en écho aux efforts des laboratoires développant des modèles VLA pour réduire leur dépendance à la téléopération humaine. Publiée en prépublication sur arXiv (2609.27308), la recherche ne mentionne aucun déploiement industriel : la validation sur robot réel reste limitée à une seule tâche, le reste se déroulant en simulation.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
3arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire
4arXiv cs.RO 

Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire

Une équipe de recherche a publié le 11 août 2026 sur arXiv (référence 2608.09410) un article intitulé "Skills in Weights, Memory in Code", présentant HyMeS, un framework hybride destiné à la manipulation robotique dépendant de la mémoire à long terme. Le système associe une politique vision-langage-action (VLA) markovienne, qui apprend les compétences motrices de bas niveau par imitation learning basée sur le gradient, à un agent de codage chargé de la gestion de la mémoire de haut niveau. Cet agent apprend par heuristique, en mettant à jour de façon itérative un système de règles exécutables à partir des retours d'essais (rollouts). Une vérification multimodale de l'achèvement des étapes, combinant signaux proprioceptifs et jugements d'un modèle vision-langage sur plusieurs images, permet de rafraîchir la mémoire en boucle fermée. Sur le benchmark RoboMemArena, HyMeS fait grimper le taux de succès cumulé moyen de 52,5% à 66,2% et le taux de succès par tâche de 41,3% à 60,1% par rapport au modèle de référence pi0.5, tout en dépassant le système concurrent PrediMem de 4,5 points en succès cumulé et 14,5 points en succès par tâche. L'enjeu dépasse la simple performance chiffrée: la plupart des politiques VLA actuelles génèrent chaque action à partir de l'observation courante ou d'un historique court et fixe, ce qui les rend inadaptées aux tâches non markoviennes où le robot doit se souvenir d'informations glanées bien plus tôt dans la séquence. En séparant les compétences motrices, apprises par imitation et figées dans les poids du réseau, de la logique de mémoire, gérée en code exécutable et adaptable sans nouvelles démonstrations, HyMeS promet une généralisation compositionnelle plus économe en données: seules les compétences motrices réutilisables nécessitent des démonstrations, pas chaque configuration de tâche dépendante de l'historique. Pour les intégrateurs et laboratoires travaillant sur des tâches industrielles multi-étapes (tri, assemblage séquentiel), c'est un argument direct contre le coût prohibitif de collecte de données propre aux approches VLA de bout en bout. Le travail s'inscrit dans la lignée des modèles VLA généralistes tels que pi0.5 (Physical Intelligence), utilisé ici comme référence, et se positionne face à d'autres approches de mémoire augmentée comme PrediMem. Il s'agit à ce stade d'un préprint arXiv validé uniquement sur le benchmark RoboMemArena, sans validation annoncée sur robot physique ni pilote industriel.

RecherchePaper
1 source