CoRef-GS : Splatting gaussien de référence coopératif pour la compréhension multi-agents de scènes
CoRef-GS, un framework de cartographie Gaussienne coopérative pour robots, a été décrit dans un article publié sur arXiv en septembre 2026 (référence 2609.20586). Le système répond à un cas concret : plusieurs robots construisent chacun une carte Gaussienne sémantique locale de leur environnement, et une fois ces cartes fusionnées, il faut pouvoir localiser un objet désigné en langage naturel même s'il n'a été observé que par un autre agent, tout en gardant les relations spatiales interprétées depuis le point de vue du robot qui pose la question. CoRef-GS construit d'abord des cartes Gaussiennes locales à vocabulaire ouvert et conscientes des instances, les aligne via un module d'alignement inter-agents combinant cohérence géométrique et sémantique, puis effectue le grounding grâce à un graphe de relations conditionné par la vue. Les auteurs introduisent aussi CoQuad-Ref, un benchmark reposant sur deux robots quadrupèdes et couvrant des scènes d'intérieur réelles et simulées : en simulation, l'erreur de rotation passe de 2,58 degrés après initialisation grossière à 0,15 degré après raffinement, et en conditions réelles le mIoU de référencement grimpe de 52,6% avec la méthode existante ReferSplat à 68,8% avec CoRef-GS. Code et benchmark doivent être publiés sur GitHub.
Ce travail cible un verrou peu traité mais central pour les flottes de robots mobiles : faire coopérer plusieurs agents sur une carte sémantique commune sans perdre la capacité à traiter des instructions en langage naturel relatives et ambiguës. Les méthodes existantes de cartographie Gaussienne consciente du langage se limitent à l'interrogation d'une carte unique, tandis que les techniques de recalage Gaussien optimisent l'alignement géométrique ou photométrique sans préserver la compatibilité sémantique nécessaire au grounding, ce que CoRef-GS cherche justement à combiner. Les gains rapportés, une erreur de pose divisée par plus de quinze en simulation et un mIoU en hausse de seize points sur données réelles, restent issus d'un seul benchmark défini par les auteurs et demandent confirmation sur d'autres plateformes avant généralisation. Pour les intégrateurs qui déploient des flottes de robots mobiles ou quadrupèdes en entrepôt ou en bâtiment, l'enjeu démontré est réel : plusieurs unités doivent partager une compréhension cohérente de l'espace pour exécuter des instructions humaines sans recartographier chaque zone individuellement.
CoRef-GS s'inscrit dans la lignée des cartes Gaussiennes sémantiques, ces représentations 3D Gaussian Splatting enrichies de features de langage développées pour le grounding dans des scènes reconstruites par un seul agent, limite que les auteurs identifient explicitement chez des approches comme ReferSplat, utilisée ici comme référence de comparaison. L'apport revendiqué est de déplacer ce paradigme vers un cadre multi-agent, testé sur des robots quadrupèdes plutôt que sur des humanoïdes ou des AMR à roues. Les auteurs annoncent la publication prochaine, en open source, du code et du benchmark CoQuad-Ref sur GitHub, ce qui permettra à la communauté de reproduire les résultats et de comparer d'autres méthodes de fusion de cartes sur le même protocole. Aucun calendrier de déploiement industriel n'est mentionné : le travail reste à ce stade une contribution de recherche académique, sans lien annoncé avec un acteur commercial.
Dans nos dossiers




