EmbodiRSI : l'auto-amélioration récursive pour une adaptation des robots économe en données
Des chercheurs publient sur arXiv EmbodiRSI, un système « agentique » d'auto-amélioration récursive (RSI) pour adapter des politiques de manipulation robotique à de nouvelles tâches et environnements. Le principe repose sur une boucle « real-to-sim-to-real » : une simulation spécifique à la tâche est construite à partir du scénario de déploiement cible, puis sert d'environnement peu coûteux pour améliorer la politique par itérations avant son retour sur le robot physique. Deux mécanismes ferment la boucle. La Collaborative Error Correction génère, avec l'aide d'un agent, des trajectoires correctives à partir des états que la politique a réellement atteints. L'Adaptive Data Collection oriente la génération de démonstrations expertes vers les faiblesses actuelles de la politique. Sur trois environnements de table et 14 sous-tâches, le taux de réussite autonome en simulation, équilibré par scène, passe de 50,4 % à 83,5 % en deux mises à jour RSI. Avec 400 trajectoires simulées adaptatives et seulement dix trajectoires réelles de raffinement par sous-tâche, le système atteint 83,1 % de réussite réelle, contre 75,0 % pour une adaptation à partir de 200 démonstrations réelles par sous-tâche.
L'enjeu est le coût de la donnée, principal goulot d'étranglement du déploiement de politiques de type VLA ou d'imitation chez les intégrateurs. Ici, le volume de données réelles est divisé par vingt (10 contre 200 démonstrations par sous-tâche) pour un résultat supérieur de plus de huit points. Si ce résultat se confirme, la simulation spécifique au site cesse d'être un simple banc d'essai et devient un espace de travail réutilisable pour le préchauffage, l'évaluation répétable, le diagnostic des échecs et la génération ciblée de données. Cela réduit la dépendance à la téléopération, coûteuse en main-d'œuvre. Le résultat nuance aussi l'idée que le sim-to-real exige une simulation généraliste : une simulation étroite, construite pour un seul déploiement, peut suffire. Des réserves s'imposent toutefois. Les tâches sont de la manipulation sur table, le nombre de sous-tâches est limité, la fidélité de la reconstruction de scène n'est pas détaillée dans le résumé, et aucun temps de cycle, taux de panne ni coût de construction de la simulation n'est donné. Le travail reste une prépublication, sans pilote industriel annoncé.
Ce travail s'inscrit dans la poussée actuelle vers l'adaptation efficace en données des politiques généralistes, alors que le fine-tuning post-entraînement par démonstrations réelles reste la pratique dominante. Il rejoint les approches de reconstruction de scènes pour la simulation (real-to-sim), de génération de données synthétiques et de boucles d'amélioration pilotées par des agents, explorées par les grands laboratoires et les équipes derrière des modèles comme Pi-0 ou GR00T. L'originalité tient au pilotage de la collecte par les échecs observés de la politique, plutôt qu'à une génération de données uniforme. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues et sur des objets déformables ou en contact riche, la réplication par des tiers, la publication du code et des benchmarks, et surtout un test en conditions industrielles, où la variabilité des scènes dépasse largement celle d'un plateau de laboratoire.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




