
Un cadre en boucle réel-simulation-réel (RSR) pour le transfert de politiques robotiques généralisables
Des chercheurs proposent un cadre « Real-to-Sim-to-Real » (RSR), publié sur arXiv dans sa troisième version (2503.10118v3), qui vise à réduire l'écart entre simulation et monde réel lors du transfert de politiques de contrôle robotique. Sa contribution centrale est une fonction de coût d'inspiration théorique de l'information. Elle pèse deux objectifs : accomplir la tâche, et orienter la politique vers la collecte d'échantillons réels les plus informatifs possible pour améliorer le transfert. Cette fonction s'intègre dans des algorithmes d'apprentissage par renforcement existants, comme PPO ou SAC, et vise une exploration équilibrée des zones critiques du domaine réel. Le cadre a été implémenté avec la plateforme MuJoCo MJX et testé sur deux familles de tâches : de la manipulation avec un bras robotique à 6 DOF, et de la locomotion avec un robot à pattes. Les auteurs annoncent une acquisition de données plus efficace et une nette amélioration des performances en conditions réelles. Le résumé ne chiffre ni les gains ni le nombre d'essais, et ne nomme ni robots ni laboratoires.
L'intérêt est de traiter le sim-to-real comme un problème de choix des données réelles à collecter, et non seulement de réglage de la simulation. Les échantillons réels coûtent cher, surtout sur des robots à pattes ou des bras industriels où chaque essai use le matériel et mobilise des opérateurs. Une politique qui cherche activement l'information manquante sur l'écart de dynamique pourrait réduire le nombre d'itérations réel-simulation nécessaires avant déploiement. Le simulateur différentiable est facultatif. Quand il existe, les données servent aussi à calibrer ses paramètres. Sinon, le cadre reste utilisable, ce qui élargit son champ d'application aux équipes sans pipeline différentiable. Il faut toutefois rester prudent : il s'agit d'un travail académique évalué sur deux plateformes, sans comparaison chiffrée visible dans le résumé, et loin d'une validation à l'échelle industrielle ou sur des tâches longues et variées.
Ce travail s'inscrit dans l'effort général pour fermer l'écart sim-to-real, qui freine le passage de l'entraînement massif en simulation aux robots déployés. La randomisation de domaine, l'identification de paramètres et les simulateurs différentiables en sont les approches classiques. Le choix de MuJoCo MJX, version accélérée sur GPU via JAX, reflète la place de ces outils dans la recherche actuelle. Les grands acteurs de l'humanoïde et des modèles de fondation robotiques s'appuient eux aussi fortement sur la simulation, ce qui rend ces méthodes d'exploration guidée potentiellement pertinentes pour eux. La suite dépendra de la publication du code, de l'évaluation sur des systèmes plus complexes et de comparaisons directes avec les méthodes existantes.
Dans nos dossiers




