Reconstruire, s'entraîner, passer au réel : l'auto-amélioration guidée des agents incarnés
Des chercheurs proposent Reconstruct, Practice, Go Real (RPG), un cadre d'amélioration autonome des systèmes d'exécution robotique qui ne touche à aucun poids de modèle. À partir d'un jeu de données hors ligne, RPG identifie les capacités de manipulation présentes et construit en simulation des tâches d'entraînement apparentées. Pendant cette phase de pratique, le système exploite les retours d'exécution, l'état privilégié du simulateur et les vidéos disponibles du jeu de données pour diagnostiquer les échecs. Il en tire de nouvelles compétences symboliques réutilisables, affine les compétences existantes et réécrit le prompt système. Chaque modification candidate, seule ou fusionnée avec d'autres, est testée sur plusieurs tâches avant d'être conservée. Au déploiement, un LLM multimodal s'appuie sur ce prompt et cette bibliothèque de compétences pour coordonner perception et contrôle. Sur 22 tâches de manipulation, avec des initialisations non vues, le taux de réussite passe de 28,6 % après le premier cycle de pratique à 95,0 % après 15 cycles. Les références testées sont dépassées : ASPIRE atteint 75,5 % et CaP-Agent0, piloté par GPT-6 Astra Pro, 60,0 %. Après une calibration et une adaptation matérielle communes, le système figé réussit les 30 essais physiques, soit dix essais sur chacune de trois tâches.
L'intérêt tient à l'approche : l'amélioration passe par du code, des compétences et des prompts, pas par du réentraînement. Pour un intégrateur, cela rend le processus plus auditable et plus facile à versionner, puisque chaque compétence ajoutée est lisible et validée en simulation avant d'être retenue. Cela s'attaque directement au coût humain de la mise au point des compétences, des fonctions de récompense et de l'intégration perception-contrôle. La progression de 28,6 % à 95,0 % suggère aussi que le goulot d'étranglement des agents pilotés par LLM se situe moins dans le modèle que dans la qualité des compétences et des instructions qui l'entourent. Il faut toutefois relativiser. Les 30 essais réels, sur trois tâches seulement, forment un échantillon très mince comparé aux 22 tâches simulées. Ils interviennent après une phase de calibration et d'adaptation matérielle dont le coût n'est pas détaillé dans le résumé. Le transfert sim-to-real reste donc plus plausible que démontré à l'échelle.
Ces travaux s'inscrivent dans la lignée des approches « code as policies », où un LLM compose des primitives de contrôle, et des méthodes d'auto-amélioration par bibliothèque de compétences, dont ASPIRE est ici le meilleur concurrent évalué. Ils se distinguent des modèles vision-langage-action (VLA) de type Pi-0 ou GR00T, qui font évoluer l'ensemble par réentraînement de poids. Les auteurs n'annoncent ni produit ni partenaire industriel. Les prochaines étapes à surveiller sont une validation sur davantage de tâches physiques, sur des manipulations plus riches et sur d'autres plateformes. La comparaison avec des VLA entraînés sur les mêmes données serait aussi utile. Le site du projet, rpg-robot.github.io, sert de point d'entrée pour vérifier les résultats.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




