Au-delà de la similarité pixel : évaluation orientée tâche de données sonar synthétiques par GAN pour la perception robotique
Une étude publiée en septembre 2026 sur arXiv (2609.18100) interroge une pratique de plus en plus répandue en robotique : générer des données sonar synthétiques par IA générative pour entraîner des systèmes de perception, sans vérifier si les métriques classiques de qualité d'image garantissent une réelle utilité pour les tâches embarquées. Les auteurs testent un GAN conditionnel de type Pix2Pix décliné en quatre configurations de discriminateur, PixelGAN, PatchGAN-16, PatchGAN-70 et ImageGAN, qui diffèrent par la taille du champ réceptif utilisé pour juger le réalisme des images générées. Entraînés sur deux jeux de données sonar réels, les modèles sont évalués à la fois avec les métriques d'image classiques, SSIM, PSNR et MSE, et par une évaluation orientée tâche : trois détecteurs d'objets, YOLOX-S, YOLOX-L et Faster R-CNN, entraînés uniquement sur des images sonar réelles, sont ensuite testés sur les images synthétiques générées par chaque configuration, avec les mêmes échantillons et annotations.
Le résultat central est une divergence nette entre les deux types d'évaluation : la configuration qui obtient les meilleurs scores SSIM, PSNR et MSE n'est pas celle qui produit les meilleures performances de détection d'objets en aval. Les configurations PatchGAN, en particulier, se montrent solides pour la détection malgré des scores de fidélité pixel inférieurs. Pour les équipes robotique qui misent sur les données synthétiques afin de réduire le coût de collecte et d'annotation de capteurs sonar, ce constat invalide l'idée qu'un score de similarité visuelle élevé suffit à garantir des données exploitables par un modèle de perception. Il plaide pour une évaluation systématiquement "task-aware", c'est-à-dire testée sur la tâche réelle, plutôt que fondée sur la seule ressemblance pixel.
Cette question s'inscrit dans un problème plus large de la robotique sous-marine et de l'inspection par capteurs acoustiques, où les données réelles sont rares, coûteuses et difficiles à annoter, poussant au recours croissant aux GANs conditionnels pour combler les manques. Le papier ne présente pas de produit ni de déploiement industriel : il s'agit d'un travail méthodologique dont les auteurs eux-mêmes limitent la portée aux jeux de données et modèles testés, appelant à généraliser cette approche d'évaluation à d'autres capteurs robotiques.
Dans nos dossiers




