
RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution
Des chercheurs présentent Agentic Real-to-Sim-to-Real (Agentic RSR), un cadre qui relie dans une même boucle la reconstruction de scène, le développement de politique et l'exécution sur robot réel, à partir d'une seule tâche de manipulation. L'entrée se limite à une vidéo de l'espace de travail, une description de la tâche et le modèle connu du robot. Un agent récupère l'échelle métrique, affine la scène par retours visuels successifs et vérifie dans MuJoCo que les interactions pertinentes pour la tâche sont bien préservées. Un agent de codage écrit ensuite une politique exécutable, en progressant des poses d'objets privilégiées vers des observations visuelles, puis vers une simulation randomisée. La politique peut enchaîner plusieurs observations et actions au sein d'un même appel, et l'agent exploite les retours d'exécution pour poursuivre, réessayer ou revoir son approche. Sur 18 scènes reconstruites impliquant deux robots, l'erreur absolue moyenne de profondeur sur quatre vues, mesurée par rapport à des estimations de référence, atteint 0,1057 m. Le ΔE76 moyen en espace Lab est de 11,04 et le SSIM moyen en niveaux de gris de 0,6990. Sur robot réel, le taux de réussite agrégé atteint 80 % de celui obtenu en simulation.
Le point notable tient à l'architecture plus qu'à une performance isolée. La reconstruction de scène et le développement de politique sont habituellement traités séparément, ce qui produit des jumeaux numériques jolis mais inutiles pour la tâche, ou des politiques entraînées sur des observations que le robot réel ne verra jamais. Ici, la scène est jugée sur sa capacité à préserver les interactions utiles, et la politique n'utilise que des observations disponibles sur le matériel. Un taux de rétention de 80 % suggère que le fossé sim-to-real peut se réduire sans entraînement massif par apprentissage par renforcement, en s'appuyant sur du code généré par un agent et corrigé par ses retours d'exécution. Pour les intégrateurs, la perspective est de déployer plus vite sur une cellule inédite à partir d'une simple vidéo. Les métriques de reconstruction restent toutefois modestes : une erreur de profondeur d'environ 10 cm et un SSIM proche de 0,70 indiquent une fidélité visuelle limitée. Le ratio de 80 % est relatif à la simulation, et le taux de réussite absolu, la diversité des tâches et le nombre d'essais ne sont pas précisés dans le résumé.
Ces travaux s'inscrivent dans la montée des approches « real-to-sim » et des agents de codage appliqués à la robotique, qui concurrencent les VLA entraînés de bout en bout, plus gourmands en données de téléopération. Ils reposent sur MuJoCo, simulateur désormais standard, et sur des modèles de perception pour la profondeur et la géométrie. L'article, publié sur arXiv (2610.10479v1), annonce que le code et les données de scènes reconstruites seront rendus publics, sans calendrier précisé. Leur diffusion permettra de vérifier si la méthode tient hors du cadre de laboratoire, sur des tâches plus longues et des environnements encombrés, ainsi que de la comparer aux politiques apprises de bout en bout.
Pas d\'impact direct sur la France/UE
Dans nos dossiers


