Aller au contenu principal
Yggdrasil : un graphe de scène 3D organisé par couches pour des requêtes en temps réel
RecherchearXiv cs.RO 

Yggdrasil : un graphe de scène 3D organisé par couches pour des requêtes en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.38640) Yggdrasil, un graphe de scène 3D (3DSG) conçu pour être efficace à la fois à la génération et à la consommation. C'est une structure hiérarchique « layer-first », bâtie sur des nœuds, des arêtes et des couches génériques. Elle peut représenter ce que produisent déjà les pipelines de perception existants, en intérieur comme en extérieur, à plat ou hiérarchique. Elle répond nativement aux requêtes positionnelles et sémantiques des tâches en aval. Face à une implémentation de référence de type DSG publiée, les requêtes sont jusqu'à 121 fois plus rapides. Toutes les requêtes mesurées prennent entre 2 et 127 microsecondes, sur un poste de travail comme sur un appareil embarqué. Les auteurs les comparent au budget de 200 microsecondes par keyframe d'un consommateur de 3DSG. Yggdrasil a été intégré à trois pipelines publiés : prédiction de trajectoire humaine, navigation vers un objet cible et planification de mouvement attentive aux humains. Le temps passé sur le graphe de scène baisse jusqu'à 99 %. L'implémentation, le banc d'essai et les trois intégrations sont disponibles en ligne.

Ce travail s'attaque à un goulot d'étranglement peu visible. Les graphes de scène 3D servent aux robots à comprendre et à manipuler leur environnement. La recherche s'est surtout concentrée sur leur construction, rarement sur leur interrogation. Chaque pipeline finit donc par contourner sa propre structure et paie une latence incompatible avec le budget temps réel de la boucle de perception. Pour un intégrateur ou un ingénieur robotique, le message est que la représentation de la scène peut peser autant que le modèle de perception ou le planificateur. Réduire de 99 % le temps consacré au graphe libère du budget de calcul, notamment sur du matériel embarqué à la puissance limitée. Il faut toutefois rester prudent. Ce sont des micro-benchmarks sur des requêtes choisies par les auteurs, comparés à une seule base de référence. La mention « premier 3DSG conçu pour la génération et la consommation » est une revendication des auteurs. Aucune démonstration sur robot physique ni déploiement industriel n'est mentionné. Il s'agit d'un preprint, et non d'un produit livré.

Le contexte est celui d'une génération de systèmes qui s'appuient sur des graphes de scène hiérarchiques, du type Hydra et ses « Dynamic Scene Graphs ». Ils relient pièces, objets et agents pour la navigation sémantique et l'interaction homme-robot. Leur croissance a multiplié les formats propres à chaque projet, avec des coûts d'accès rarement évalués. Yggdrasil vise un format commun et peu coûteux à interroger. Son code ouvert et ses trois intégrations permettent à d'autres équipes de reproduire les résultats. La suite dépendra d'une adoption par d'autres pipelines, de tests sur des scènes dynamiques et de grande échelle, et d'une validation sur des plateformes mobiles réelles. Le preprint n'annonce ni pilote industriel ni calendrier.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure
1arXiv cs.RO 

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure

Des chercheurs ont publié en mai 2026 (arXiv:2605.17661) Mono-Hydra++, un pipeline temps réel capable de construire des graphes de scène 3D hiérarchiques d'intérieurs en n'utilisant qu'une caméra RGB monoculaire et une IMU, sans capteur de profondeur actif. Le coeur du système repose sur M2H-MX, un modèle multi-tâches fondé sur DINOv3 qui estime simultanément la profondeur et la sémantique des images. Ces estimations alimentent un front-end d'odométrie visuelle-inertielle (VIO) enrichi de contraintes de profondeur prédites creuses, d'un masquage sémantique des zones dynamiques et d'un alignement temporel tenant compte de la pose, avant fusion volumétrique dans le backend Mono-Hydra. Sur le sous-ensemble d'évaluation Go-SLAM/ScanNet, le système affiche 1,6 % d'erreur de trajectoire en moins que le meilleur baseline RGB-D testé ; sur le benchmark calibré 7-Scenes, il réduit l'ATE moyen de 29,8 % par rapport au meilleur concurrent calibré. Le modèle de perception M2H-MX-L, exporté en ONNX/TensorRT FP16, tourne à 25,53 FPS sur un Jetson Orin NX 16 Go, et le pipeline a été validé dans un déploiement réel dans un bâtiment ITC avec une caméra RealSense RGB + IMU. L'impact industriel est direct pour les plateformes à contraintes sévères : drones d'inspection, robots humanoïdes légers et AMR embarquant peu de puissance. Jusqu'ici, la construction de graphes de scène 3D, qui organisent l'espace en objets, pièces et relations spatiales, nécessitait des capteurs actifs (RGB-D ou LiDAR) impraticables dès que le payload ou la consommation électrique sont limités. Mono-Hydra++ démontre qu'il est possible d'atteindre, voire de dépasser, la précision de ces baselines lourds avec une seule caméra et une IMU bas coût. Pour un intégrateur ou un COO industriel, cela signifie une réduction substantielle du coût matériel embarqué et l'ouverture de cas d'usage où le RGB-D n'est pas envisageable. Il convient toutefois de noter que les résultats sont issus de benchmarks académiques standardisés : la robustesse sur des scènes industrielles non contrôlées, avec éclairages difficiles ou textures répétitives, reste à confirmer dans des conditions opérationnelles réelles. Mono-Hydra++ s'inscrit dans la lignée du système Hydra du MIT, qui a posé les bases de la représentation hiérarchique en graphe de scène pour la robotique. L'utilisation de DINOv3 comme backbone de vision fondationnelle est cohérente avec la tendance forte à extraire simultanément géométrie et sémantique depuis des modèles pré-entraînés à grande échelle. Sur ce terrain, les concurrents directs incluent les systèmes basés sur RGB-D comme Go-SLAM, iMAP ou NICE-SLAM, ainsi que des approches VIO-sémantiques récentes, mais peu proposent la combinaison complète cartographie métrique, sémantique et graphe de scène en temps réel sur matériel embarqué contraint. En tant que preprint arXiv non encore évalué par les pairs, les prochaines étapes attendues sont la publication en conférence (IROS, ICRA), des tests sur plateformes aériennes effectives et une éventuelle intégration dans des stacks robotiques open-source comme ROS 2.

UELes constructeurs européens d'AMR légers et de drones d'inspection pourraient à terme réduire leurs coûts matériels embarqués en remplaçant les capteurs RGB-D par une caméra monoculaire, sous réserve de validation dans des conditions industrielles non contrôlées.

RecherchePaper
1 source
Graphes de scène probabilistes : représentation hiérarchique et système en temps réel
2arXiv cs.RO 

Graphes de scène probabilistes : représentation hiérarchique et système en temps réel

Des chercheurs présentent dans un nouvel article publié sur arXiv (référence 2609.23144v1) un système de représentation de scènes 3D pour la perception robotique baptisé Probabilistic Scene Graph (PSG). Contrairement aux scene graphs classiques, qui figent une structure d'entités, de relations et d'attributs sémantiques, PSG modélise une distribution de probabilité sur l'ensemble des graphes possibles : une structure discrète (objets, relations, sémantique) couplée à des états continus qui les situent dans l'espace, avec une incertitude explicite sur les deux composantes. La géométrie est portée directement par les nœuds plutôt que puisée dans une carte métrique construite à part ; la carte, quand elle est utile, découle du graphe et non l'inverse. Les auteurs instancient cette idée via des Hierarchical Graphs of Gaussians (HGG) : chaque objet est représenté par une gaussienne à covariance complète sous une croyance Normal-Inverse-Wishart, le même schéma étant réappliqué récursivement pour affiner la résolution de surface. Le pipeline combine un alignement grossier-vers-fin fondé uniquement sur le graphe et une optimisation imbriquée Expectation-Maximization / factor-graph qui raffine conjointement poses, paramètres d'objets et géométrie interne. Testé sur six jeux de données (intérieur RGB-D, extérieur LiDAR, scénarios multimodaux), le système tourne à la cadence des capteurs avec une mémoire quasi constante. Ce travail cible une limite structurelle des scene graphs 3D en robotique : l'incertitude y est aujourd'hui traitée en aval, jamais propagée pendant la construction du graphe lui-même. Pour les équipes développant des piles de perception pour navigation autonome, manipulation ou SLAM sémantique, cette lacune fragilise les graphes face au bruit capteur ou aux fusions d'observations erronées. En couplant nativement structure sémantique et incertitude géométrique, PSG vise des cartes robustes même avec des données partielles ou ambiguës, un enjeu direct pour les intégrateurs fusionnant des capteurs hétérogènes en conditions réelles. Les résultats revendiqués, précision « état de l'art » et alignement de graphe en zero-shot, restent des mesures de benchmark académique et non un déploiement industriel validé. L'approche prolonge les travaux sur les scene graphs 3D hiérarchiques utilisés en robotique pour structurer la perception au-delà des nuages de points ou cartes d'occupation, mais rompt avec ces systèmes déterministes en adoptant un cadre bayésien complet où chaque étape (association, fusion, raffinement de pose) manipule des croyances plutôt que des estimations ponctuelles. Elle se positionne face aux pipelines de cartographie sémantique classiques et aux méthodes de reconstruction par gaussiennes issues de la vision par ordinateur, dont elle reprend la représentation continue en l'intégrant à une structure de graphe discrète. L'article, classé comme nouvelle soumission arXiv, ne mentionne aucun partenariat industriel ni feuille de route de déploiement : c'est à ce stade une contribution de recherche évaluée sur données publiques, dont l'adoption dépendra de sa reproduction par la communauté.

RecherchePaper
1 source
Voir vite et lentement : graphes de scènes 3D bimodaux pour tâches en domaine ouvert
3arXiv cs.RO 

Voir vite et lentement : graphes de scènes 3D bimodaux pour tâches en domaine ouvert

Des chercheurs ont publié en mai 2026 sur arXiv (identifiant 2605.31067) BiMoSG, un système de génération de graphes de scène 3D bimodal conçu pour l'exécution de tâches à vocabulaire ouvert en robotique autonome. Le principe repose sur deux modes distincts : un mode "rapide" actif par défaut, qui construit une représentation grossière de l'environnement, et un mode "lent" déclenché automatiquement lorsque le robot identifie des zones susceptibles de contenir des objets pertinents pour la tâche en cours. Ce second mode génère un graphe de scène 3D à granularité fine, compatible avec des requêtes sémantiques en langage naturel (open-vocabulary), sans liste d'objets prédéfinie. Les auteurs affirment surpasser en vitesse les approches open-source de référence, sans toutefois publier de métriques chiffrées précises dans l'abstract disponible, un point à vérifier dans le corpus complet avant d'en tirer des conclusions fermes. Ce système s'attaque à une tension structurelle bien connue en robotique de terrain : les représentations haute fidélité sont computationnellement coûteuses et inutiles dans les zones sans intérêt, tandis que les représentations grossières sont insuffisantes au moment de localiser un objet cible. BiMoSG tente de résoudre ce compromis de façon dynamique et contextuelle, ce qui est directement pertinent pour les intégrateurs d'AMR (autonomous mobile robots) en entrepôt ou en logistique industrielle, où le temps de cycle de la couche de perception est un goulot d'étranglement réel. La capacité annoncée à coupler la génération du graphe de scène avec l'exécution de tâches en temps réel, si elle se confirme en déploiement physique, représenterait un pas concret vers des systèmes open-set opérationnels au-delà des démonstrations en environnement contrôlé. Les graphes de scène 3D constituent un champ de recherche actif depuis les travaux fondateurs comme Kimera (MIT, 2020) et les approches plus récentes exploitant des encodeurs visuels de type CLIP pour le matching sémantique, tels que ConceptGraphs ou OpenGraph. BiMoSG s'inscrit dans cette lignée en proposant une stratégie d'allocation de ressources perceptives inspirée du cadre dual-process (cognition rapide versus lente), appliqué ici à la perception robotique. Il s'agit d'une contribution académique sous forme de preprint : aucun partenariat industriel, aucun calendrier de déploiement ni benchmark sur jeux de données standardisés (ScanNet, Replica) ne sont mentionnés dans la version initiale. Les étapes naturelles attendues sont une évaluation quantitative comparative et des tests sur plateformes physiques réelles.

RecherchePaper
1 source
Graphes de scène 3D en ensemble ouvert pour la robotique de terrain : étude de cas en extérieur
4arXiv cs.RO 

Graphes de scène 3D en ensemble ouvert pour la robotique de terrain : étude de cas en extérieur

Des chercheurs publient le 7 septembre 2026 sur arXiv (2609.04607v1) un rapport de terrain sur les graphes de scène 3D en robotique extérieure, testant le système Terra 3DSG sur cinq jeux de données robotiques outdoor distincts. Ces cartes hiérarchiques combinent géométrie et sémantique via des modèles vision-langage en ensemble ouvert (VLM open-set), afin de permettre un raisonnement robotique de haut niveau. L'étude introduit de nouvelles métriques de cohérence pour vérifier si les propriétés sémantiques et structurelles du graphe restent stables lors de traversées répétées du même environnement. Résultats chiffrés : les embeddings de points sémantiques produits par les VLM présentent des valeurs aberrantes et des modes multiples sur l'ensemble des jeux de données testés, avec un ratio d'outliers supérieur à 0,1 pour environ 30% des points. La récupération d'objets par navigation atteint un taux de succès proche de 70%, mais les trajectoires affichent en moyenne environ 66% d'inefficacité par rapport au chemin optimal, freinées par des échecs de franchissabilité du terrain et un routage peu efficace. La compréhension au niveau des régions reste limitée, avec un score F1 moyen de seulement 0,359. En revanche, la représentation reste compacte, moins de 600 Mo pour des trajectoires de plusieurs kilomètres. Ces résultats importent car ils testent en conditions réelles une hypothèse répandue dans la recherche en robotique cognitive : que les graphes de scène 3D couplés à des VLM en ensemble ouvert peuvent servir de carte générale pour la navigation et la manipulation. L'étude nuance cet optimisme en documentant des limites concrètes, la sémantique visuelle reste bruitée en extérieur, la planification de trajectoire ignore encore la franchissabilité réelle du terrain, et la compréhension de régions naturelles complexes (forêts, terrains accidentés) reste un problème ouvert. Pour les intégrateurs travaillant sur des robots de terrain, drones, quadrupèdes, véhicules autonomes agricoles ou d'inspection, ce constat signale que les architectures VLA et les cartes sémantiques validées en intérieur ou en environnement urbain simulé ne se transposent pas directement à l'extérieur sans adaptation. Le travail s'inscrit dans la lignée des recherches sur les 3DSG initiées ces dernières années pour doter les robots de représentations de scène exploitables par des modèles de langage, jusqu'ici majoritairement validées en intérieur. Terra 3DSG sert ici de cas d'étude représentatif plutôt que de produit commercial abouti, l'article se positionnant explicitement comme une analyse de limites plutôt qu'une annonce de performance. Les auteurs identifient trois pistes de travail futures : mieux gérer les modes sémantiques multiples dans les embeddings, intégrer la franchissabilité du terrain directement dans la structure du graphe, et améliorer la compréhension sémantique au niveau des régions, autant de chantiers ouverts avant un déploiement robuste en extérieur à grande échelle.

RecherchePaper
1 source