GlassFormer : apprentissage de la segmentation du verre en temps réel par fusion radar-profondeur
Des chercheurs présentent sur arXiv (2609.36844) GlassFormer, un réseau de segmentation de surfaces transparentes qui fusionne un radar à ondes millimétriques avec un capteur RGB-D. Le réseau est un transformeur léger, et le radar y est injecté par attention inter-modale sous la forme d'un a priori spatial. Les auteurs l'évaluent sur deux jeux de test : un split mixte couvrant tous les types de scènes, où GlassFormer atteint 0,88 mIoU, et un split dédié aux conditions de faible luminosité, conçu pour mettre en difficulté les méthodes purement visuelles, où il atteint 0,59 mIoU. Ils affirment que l'inférence tourne en temps réel sur des plateformes à ressources limitées. L'article ne donne ni la carte embarquée testée, ni la fréquence d'images, ni la taille des jeux de données dans son résumé. Il s'agit d'un travail de recherche, sans produit ni déploiement associé.
Le vitrage est un cas d'échec connu de la perception robotique. La caméra RGB voit l'arrière-plan derrière la vitre, et les capteurs de profondeur (LiDAR, temps de vol, RGB-D) renvoient des mesures invalides ou celles du fond. Un robot mobile peut alors prendre une cloison vitrée, une porte ou un miroir pour de l'espace libre. C'est un risque de collision, et aussi un risque de sécurité pour les AMR et les humanoïdes qui évoluent dans les bureaux, hôpitaux, halls, commerces et entrepôts vitrés. L'idée centrale est d'exploiter l'incohérence entre modalités : le radar réfléchit fortement sur le verre, alors que la vision et la profondeur échouent au même endroit. Le résultat sur le split faible luminosité est le plus instructif. Les indices visuels appris par les approches RGB (reflets, contours, contexte sémantique) se dégradent dans le noir, en cas d'éblouissement ou face à un verre sans texture. Les 0,59 mIoU montrent que le radar aide beaucoup, mais qu'un problème reste ouvert : le score est nettement inférieur à celui du split mixte. Les gains face aux bases visuelles restent à vérifier, car le résumé ne les chiffre pas. Ils sont évalués sur les splits des auteurs, sans preuve de généralisation à d'autres capteurs ou bâtiments.
Jusqu'ici, la segmentation du verre reposait surtout sur des réseaux RGB ou RGB-D, qui apprennent des indices visuels et fonctionnent bien sous un éclairage et un angle favorables. Le radar millimétrique est déjà présent sur beaucoup de plateformes mobiles pour sa robustesse à la lumière, à la poussière et à la fumée, mais il reste peu utilisé pour la cartographie sémantique fine. Pour les intégrateurs, cela ouvre la voie à des capteurs peu coûteux ajoutés aux piles de perception existantes, au lieu de LiDAR plus chers. Les prochaines étapes probables sont des tests sur robot réel, des comparaisons avec des méthodes multimodales concurrentes, la publication du jeu de données et du code, et une intégration à la navigation. Rien de tel n'est annoncé à ce stade.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




