Encore : découverte à base d'agents de stratégies de manipulation à partir de quelques démonstrations
Des chercheurs présentent ENCORE, un système où un agent de programmation apprend des stratégies de manipulation robotique à partir de quelques démonstrations, non pas comme données d'entraînement mais comme éléments à lire et analyser. Un « builder » déterministe transforme chaque démonstration en un dossier regroupant des images clés multi-vues, les événements du gripper, des bandes d'images et la trajectoire complète. L'agent étudie ce dossier, écrit un programme de politique de contrôle s'appuyant sur une API fixe de perception et d'action, l'affine sur quelques essais de développement, puis le fige avant une évaluation scellée qui ne révèle jamais le signal de succès. Sur LIBERO-PRO, le premier programme produit par l'agent réussit déjà la moitié des tâches perturbées lorsqu'il dispose de démonstrations, contre une seule tâche sans elles. Une fois figés, les programmes atteignent 96,3 % de réussite, contre 89,3 % pour le meilleur système agentique antérieur utilisant le même modèle de langage. Sur RoboDojo, dont les consignes ne précisent pas le but, aucun programme ne réussit sans démonstrations. Le système fonctionne aussi sur un robot bimanuel réel, qui apprend le passage de cube d'une main à l'autre et le retournement de tasse à partir de cinq démonstrations chacune.
L'intérêt tient à ce que ce travail déplace le problème. Les agents de code savent écrire et déboguer des programmes, mais une consigne en une phrase ne dit rien de la prise, de l'ordre des contacts ou de l'état final attendu, et l'agent en est réduit à l'essai-erreur. Les résultats sur RoboDojo montrent que ces informations ne se devinent pas : sans démonstration, le taux de réussite est nul. L'approche produit des politiques sous forme de code, donc lisibles et modifiables, ce qui attire les intégrateurs qui redoutent l'opacité des VLA. Le protocole d'évaluation scellé répond aussi à une critique fréquente sur les benchmarks agentiques, où le signal de succès peut fuiter vers l'agent. Il faut toutefois rester prudent : LIBERO-PRO est un banc de test simulé, l'écart de 7 points porte sur un seul modèle de langage, et la validation réelle se limite à deux tâches simples sur un seul robot.
Ce travail s'inscrit dans deux courants. D'un côté, les modèles VLA comme Pi-0 ou GR00T apprennent des politiques de bout en bout à partir de grands volumes de données. De l'autre, les systèmes agentiques qui génèrent du code de contrôle à partir de modèles de langage, dont ENCORE dépasse le meilleur représentant testé. La question qui reste ouverte est celle du passage à l'échelle : des tâches longues, des objets déformables, des scènes non structurées. L'article, publié sur arXiv (2609.37359), ne mentionne ni déploiement industriel ni calendrier de pilote.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




