RoboRSI : auto-évolution stable, efficace et réutilisable des robots dans des environnements réels complexes
Des chercheurs publient RoboRSI, un système d'auto-amélioration pour robots généralistes, décrit dans l'article arXiv 2610.12424. L'idée de départ est que les agents robotiques qui agissent par code savent déjà corriger leurs programmes à partir du retour d'exécution. Le problème, resté ouvert, est d'organiser cette expérience autour de la structure de la tâche. Chaque correction doit être attribuée à la capacité réellement responsable, appuyée sur des preuves d'exécution et validée avant d'être réutilisée. RoboRSI repose sur le Top-Down Skill Refinement (TSR). Cette méthode décompose les tâches en compétences composées, atomiques et de base, chacune avec un périmètre de responsabilité et un contrat explicite d'entrées et de sorties. Le résultat de chaque exécution est imputé à la branche fautive, et la révision reste confinée à cette branche. Quatre rôles se coordonnent: un Manager, un Planner, un Engineer et un Reviewer. Ils gèrent la planification, l'exécution, le diagnostic et la publication validée des nouvelles compétences. Les humains pilotent le processus par des objectifs et des corrections, et les séquences stables de compétences sont consolidées en compétences composées réutilisables.
Les résultats portent sur deux terrains. Sur un manipulateur mobile, le système développe une tâche de rangement ménager multi-objets en 104 rounds d'amélioration. En simulation, il obtient le meilleur taux de réussite sur LIBERO, LIBERO-PRO, LIBERO-Plus et RoboTwin, devant la meilleure référence avec un écart de 2,7 à 11,0 points de pourcentage. Le résumé ne précise ni le matériel utilisé, ni le taux de réussite final en conditions réelles, ni l'identité des références comparées. L'essai réel ressemble donc à une démonstration sur une seule tâche domestique, et on ne sait pas encore s'il généralise.
Pour les intégrateurs et les responsables industriels, l'intérêt est la traçabilité. Une architecture où une erreur est rattachée à une compétence précise, corrigée localement puis validée avant diffusion répond à un frein bien connu du déploiement: les régressions silencieuses après chaque mise à jour. Les politiques VLA de bout en bout sont difficiles à auditer, alors qu'un code modulaire avec contrats d'entrées et de sorties se prête mieux à la certification et à la maintenance. Le travail suggère aussi que l'amélioration continue peut passer par la capitalisation de compétences plutôt que par le réentraînement de gros modèles. Les gains en simulation, de 2,7 à 11,0 points, restent modestes selon le benchmark. LIBERO et RoboTwin sont par ailleurs des environnements très étudiés, dont les scores ne garantissent pas la robustesse sur site.
Ce travail s'inscrit dans la montée des agents robotiques générant du code, qui utilisent des modèles de langage pour composer des primitives, face aux approches VLA comme Pi-0 ou GR00T, qui apprennent directement des actions. Les benchmarks LIBERO-PRO et LIBERO-Plus ont été conçus pour mesurer la robustesse de ces politiques, et leur usage ici place RoboRSI dans cette comparaison. Il s'agit d'une publication de recherche sur arXiv, sans produit, client ni calendrier de déploiement annoncés. Les prochaines étapes à surveiller sont la publication du code et des compétences, des tests sur d'autres plateformes et des essais hors laboratoire.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




