Mesurer les effets de la reconstruction des objets et des scènes dans l'évaluation de robots en réel-vers-simulation
Des chercheurs publient sur arXiv (2610.00731) une étude qui mesure l'effet de la qualité de reconstruction des objets et de la scène sur la fidélité de l'évaluation robotique en simulation. L'équipe a bâti deux versions simulées d'une même cellule bimanuelle à partir des mêmes photos d'objets et de la même vidéo de scène. La version « authored » combine une géométrie d'objet à l'échelle métrique estimée, des textures projetées, des paramètres physiques définis manuellement et un splat de scène maison. La version de référence, dite « default », suit la recette open source courante : un maillage généré à partir d'une seule image, une physique par défaut du moteur et une scène en Gaussian splatting. Deux politiques ont été testées sur cinq tâches, soit dix paires tâche-politique. Chacune a été jouée vingt fois dans chaque reconstruction, tous les autres réglages étant figés, puis comparée aux mêmes essais réels notés par un évaluateur tiers. La corrélation de Pearson entre moyennes simulées et réelles atteint r = 0,90 pour la version authored, contre 0,51 pour la version default. L'erreur moyenne de score passe de 17,54 à 6,97 points de pourcentage, soit 10,56 points de moins.
Ces chiffres touchent à une question centrale pour les équipes qui déploient des politiques VLA ou d'imitation : jusqu'où la simulation peut remplacer des essais réels, coûteux et peu répétables. Une corrélation de 0,51 ne permet guère de classer des politiques de façon fiable, alors que 0,90 commence à le permettre. Le résultat indique que l'écart sim-to-real dépend en grande partie de choix de reconstruction (échelle métrique, physique, fidélité visuelle) et pas seulement du simulateur. Pour un intégrateur ou un responsable de R&D, cela plaide pour investir dans la qualité des actifs avant de multiplier les runs simulés. Les limites sont nettes : un seul robot et une seule cellule, deux politiques, cinq tâches, dix points de comparaison seulement, ce qui rend l'intervalle de confiance de la corrélation large. Le travail de modélisation manuelle représente aussi un coût que l'étude ne chiffre pas, et l'amélioration vient d'un paquet de changements dont chaque composante n'est pas isolée.
L'évaluation en simulation gagne du terrain à mesure que les politiques généralistes se multiplient et que l'évaluation sur robot réel devient le goulot d'étranglement. Les pipelines « real-to-sim » reposent de plus en plus sur le Gaussian splatting et sur des modèles génératifs image-vers-3D, dont les maillages sont rapides à produire mais souvent mal mis à l'échelle et physiquement approximatifs, ce que ce travail met en évidence. Les auteurs publient le harnais d'évaluation, les scores par essai, la configuration de chaque run ainsi que les actifs et scènes des deux reconstructions, ce qui permet à d'autres équipes de reproduire et d'étendre la comparaison. Les prochaines étapes naturelles seraient d'autres robots, davantage de politiques et une décomposition des gains par composante. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




