Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain
Des chercheurs proposent LYRA, un cadre de génération de code robotique qui apprend des compétences de manière continue à partir des retours humains. Il vise les tâches de manipulation dites « ultra-longues », où l'enchaînement d'actions dépasse ce qu'un grand modèle de langage (LLM) sait produire de façon fiable en une seule passe. Le système distille chaque correction humaine en compétences modulaires et réutilisables, puis étend leurs fonctionnalités au fil des interactions sans écraser les comportements déjà acquis. Une mémoire externe stocke ces compétences et des exemples d'exécution. Une récupération augmentée (RAG) sélectionne les connaissances pertinentes pour chaque tâche. Quand cette récupération ne suffit pas, l'utilisateur donne un indice pour orienter la réutilisation. Les auteurs annoncent un taux de succès de 0,93, jusqu'à 27 % au-dessus des méthodes de référence, et un gain de 42 % en efficacité de correction, c'est-à-dire en nombre d'interventions humaines nécessaires. Les tests couvrent les benchmarks Ravens, Franka Kitchen, LIBERO-long et MetaWorld, ainsi que des tâches en conditions réelles. LYRA réussit notamment la tâche « construire une maison », qui exige de planifier plus de 20 primitives.
Ce travail s'attaque à un point faible connu de la robotique pilotée par LLM. Les modèles traduisent bien une consigne en code, mais l'ambiguïté des instructions, le bruit des générations et la fenêtre de contexte limitée rendent les longues séquences peu fiables. Les boucles fermées qui reposent seulement sur le retour d'un LLM ne règlent pas le problème, car ces modèles raisonnent mal sur l'état physique d'un robot, même quand l'erreur saute aux yeux d'un humain. L'intérêt pour un intégrateur est concret : plutôt que de réentraîner un modèle ou de réécrire des prompts à chaque correction, l'opérateur enrichit une bibliothèque de compétences qui se transmet d'une tâche à l'autre. Cela limite l'oubli catastrophique, fréquent quand les retours s'accumulent dans des représentations qui généralisent mal. L'approche est une alternative à bas coût aux modèles vision-langage-action (VLA) entraînés de bout en bout, mais elle déplace la charge vers l'humain dans la boucle. Les résultats sont à lire avec prudence : il s'agit d'un preprint sans validation par les pairs. Les benchmarks sont en grande partie simulés. L'article ne donne pas de temps de cycle, de robot industriel ni de volume de déploiement. Le gain de 27 % est relatif aux méthodes de référence choisies par les auteurs.
Le papier arrive en version 3 sur arXiv (2509.18597), ce qui indique plusieurs cycles de révision depuis la première soumission de septembre 2025. Il s'inscrit dans la lignée des approches de génération de code pour la robotique, comme Code as Policies, qui font du LLM un planificateur écrivant des appels à des primitives. Il s'oppose à la voie des VLA généralistes (Pi-0, GR00T, Helix), qui encodent la compétence dans les poids du modèle. Aucun partenaire industriel, calendrier de pilote ni publication de code n'est mentionné dans le résumé. La suite logique serait un test sur bras industriels avec des opérateurs non experts, et une mesure de la façon dont la bibliothèque de compétences se comporte à grande échelle, quand la récupération doit trier des centaines de compétences.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




