Graphes de scène probabilistes : représentation hiérarchique et système en temps réel
Des chercheurs présentent dans un nouvel article publié sur arXiv (référence 2609.23144v1) un système de représentation de scènes 3D pour la perception robotique baptisé Probabilistic Scene Graph (PSG). Contrairement aux scene graphs classiques, qui figent une structure d'entités, de relations et d'attributs sémantiques, PSG modélise une distribution de probabilité sur l'ensemble des graphes possibles : une structure discrète (objets, relations, sémantique) couplée à des états continus qui les situent dans l'espace, avec une incertitude explicite sur les deux composantes. La géométrie est portée directement par les nœuds plutôt que puisée dans une carte métrique construite à part ; la carte, quand elle est utile, découle du graphe et non l'inverse. Les auteurs instancient cette idée via des Hierarchical Graphs of Gaussians (HGG) : chaque objet est représenté par une gaussienne à covariance complète sous une croyance Normal-Inverse-Wishart, le même schéma étant réappliqué récursivement pour affiner la résolution de surface. Le pipeline combine un alignement grossier-vers-fin fondé uniquement sur le graphe et une optimisation imbriquée Expectation-Maximization / factor-graph qui raffine conjointement poses, paramètres d'objets et géométrie interne. Testé sur six jeux de données (intérieur RGB-D, extérieur LiDAR, scénarios multimodaux), le système tourne à la cadence des capteurs avec une mémoire quasi constante.
Ce travail cible une limite structurelle des scene graphs 3D en robotique : l'incertitude y est aujourd'hui traitée en aval, jamais propagée pendant la construction du graphe lui-même. Pour les équipes développant des piles de perception pour navigation autonome, manipulation ou SLAM sémantique, cette lacune fragilise les graphes face au bruit capteur ou aux fusions d'observations erronées. En couplant nativement structure sémantique et incertitude géométrique, PSG vise des cartes robustes même avec des données partielles ou ambiguës, un enjeu direct pour les intégrateurs fusionnant des capteurs hétérogènes en conditions réelles. Les résultats revendiqués, précision « état de l'art » et alignement de graphe en zero-shot, restent des mesures de benchmark académique et non un déploiement industriel validé.
L'approche prolonge les travaux sur les scene graphs 3D hiérarchiques utilisés en robotique pour structurer la perception au-delà des nuages de points ou cartes d'occupation, mais rompt avec ces systèmes déterministes en adoptant un cadre bayésien complet où chaque étape (association, fusion, raffinement de pose) manipule des croyances plutôt que des estimations ponctuelles. Elle se positionne face aux pipelines de cartographie sémantique classiques et aux méthodes de reconstruction par gaussiennes issues de la vision par ordinateur, dont elle reprend la représentation continue en l'intégrant à une structure de graphe discrète. L'article, classé comme nouvelle soumission arXiv, ne mentionne aucun partenariat industriel ni feuille de route de déploiement : c'est à ce stade une contribution de recherche évaluée sur données publiques, dont l'adoption dépendra de sa reproduction par la communauté.
Dans nos dossiers




