Sortir et revenir : ancrage du monde et du comportement dans le co-entraînement Real2Sim2Real
Une équipe de chercheurs publie sur arXiv (2610.00821) une étude sur l'usage de la simulation pour enrichir des démonstrations réelles rares dans le co-entraînement de politiques robotiques. Les auteurs distinguent deux axes qu'ils font varier indépendamment dans un pipeline « real2sim2real ». Le premier, le « world grounding », aligne la simulation sur le système réel. Le second, le « behavior grounding », aligne les trajectoires simulées sur le mouvement humain. Le test porte sur une tâche dynamique de tri et de saisie dextre. Avec un co-entraînement entièrement ancré sur les deux axes, le taux de réussite passe de 52 % à 86 %. En moyenne sur toutes les configurations, le world grounding apporte 18 points de pourcentage et le behavior grounding 10 points. Les politiques déployées se comportent comme un mélange de deux politiques : l'une dérivée du réel, l'autre dérivée de la simulation. Elles imitent les démonstrations réelles dans les états couverts par celles-ci et s'appuient sur le comportement simulé ailleurs, ce que les auteurs examinent par une analyse de l'espace latent.
Pour les équipes qui doivent arbitrer leur budget de données, le résultat est utile parce qu'il chiffre des effets que le secteur traite souvent de façon intuitive. Le world grounding apparaît comme l'investissement prioritaire : il permet à la politique d'exploiter l'expérience simulée au-delà de la zone couverte par les données réelles, donc d'étendre la robustesse sans multiplier les téléopérations coûteuses. Le behavior grounding compte surtout lorsque l'alignement du monde est imparfait, ce qui est le cas de la plupart des simulateurs de contact et de dextérité. L'étude nuance l'idée d'un sim-to-real « résolu » : un gain de 34 points reste conditionné à un travail de calibration explicite. Les auteurs indiquent aussi que la simulation ancrée reste bénéfique lors du co-entraînement de modèles de fondation. Les résultats se limitent toutefois à une tâche unique, et l'abstract ne précise ni le robot, ni le nombre de démonstrations, ni le nombre d'essais. La marge statistique de ces pourcentages n'est donc pas évaluable à ce stade.
Ces travaux s'inscrivent dans le débat sur la manière de combler la pénurie de données robotiques. Les approches se partagent entre téléopération à grande échelle, vidéos humaines et génération synthétique en simulation, chacune avec ses limites de coût et d'écart de réalité. Des acteurs comme Nvidia, avec son écosystème Isaac et GR00T, Physical Intelligence avec Pi-0, ou Figure avec Helix, misent sur des mélanges de ces sources. Cet article, une prépublication non encore relue par des pairs, apporte une grille de lecture expérimentale sur ce que la simulation doit reproduire pour être utile. Reste à voir si ces proportions se confirment sur d'autres tâches, d'autres plateformes et à plus grande échelle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




