Explorer, exécuter, évoluer : une boucle d'acquisition et de réutilisation de compétences pour agents incarnés
Des chercheurs proposent RoboSkill, un cadre logiciel qui permet à un agent multimodal généraliste de piloter un robot en accumulant puis en réutilisant des compétences, plutôt qu'en repartant de zéro à chaque tâche. Le principe tient en une boucle « Explorer, Exécuter, Évoluer ». L'agent explore pour collecter les informations utiles à la tâche, exécute en s'adaptant aux retours de l'environnement, puis fait évoluer une bibliothèque de compétences à partir de ses traces d'exécution. Ces compétences guident ensuite l'exploration et l'exécution du cycle suivant. Deux ajouts visent l'efficacité : un retour tactile qui complète la vision pour lever les ambiguïtés lors des contacts, et du code réutilisable qui vient enrichir les consignes textuelles pour réduire le raisonnement nécessaire à la réutilisation. Sur le benchmark de simulation LIBERO-10, avec quatre agents différents, le taux de réussite dès le premier épisode progresse de 12,5 à 25,0 points de pourcentage et le temps d'exécution moyen baisse de 7,6 à 72,4 %. Sur robots réels, le gain de réussite est de 8,3 points, avec une réduction du temps moyen des essais réussis d'au moins 14,4 %.
L'intérêt tient au coût d'exécution, un point faible des agents généralistes en zero-shot. Les modèles vision-langage-action (VLA) et les modèles monde-action montrent de fortes capacités, mais généralisent mal aux tâches inédites. Les agents multimodaux à usage général comblent en partie ce manque, au prix d'un raisonnement et d'une exploration physique répétés à chaque tentative, donc de latence et de coût. RoboSkill suggère qu'une mémoire procédurale exécutable (du code, pas seulement du texte) peut transformer ce coût récurrent en investissement amorti. Pour un intégrateur, l'enjeu est de savoir si un agent apprend d'un déploiement à l'autre sans réentraînement. Des réserves s'imposent toutefois : le gain de 8,3 points sur robot réel est modeste, l'écart entre simulation et réel reste visible, et la taille des essais physiques, les tâches et la nature des capteurs tactiles ne sont pas détaillées dans le résumé. L'amplitude très large des réductions de temps (jusqu'à 72,4 %) dépend fortement de l'agent de base.
Ce travail s'inscrit dans la tendance des agents « à bibliothèque de compétences », déjà explorée dans les agents de jeu et de code, ici transposée à la manipulation physique. Il se positionne en complément, et non en concurrent, des VLA et des modèles monde-action, qui restent la voie dominante pour la commande bas niveau. Il s'agit d'une prépublication arXiv (v1), non évaluée par les pairs, sans annonce de produit ni de déploiement industriel. Les suites logiques sont la validation sur des tâches longues et variées, la mesure de la robustesse de la bibliothèque de compétences dans le temps et la démonstration d'un transfert d'un robot à un autre.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




