Aller au contenu principal
OREN-X : réseau octree résiduel pour la cartographie multimodale en temps réel
RecherchearXiv cs.RO 

OREN-X : réseau octree résiduel pour la cartographie multimodale en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié en septembre 2026 sur arXiv (2609.29157), OREN-X est un système de cartographie 3D temps réel pour robots qui réunit dans un même octree trois informations traitées jusque-là séparément : la géométrie pour la planification, la radiance pour le rendu et la relocalisation, et des features vision-langage pour la reconnaissance d'objets en vocabulaire ouvert. Un apprentissage de dictionnaire en ligne comprime ces features jusqu'à 3,7 fois tout en améliorant la précision des requêtes. Sur le benchmark Replica, OREN-X cartographie à plus de 80 images par seconde pour le SDF (distance signée) seul et plus de 30 images par seconde pour les quatre modalités combinées, avec une précision SDF améliorée de 33% et un score mIoU en vocabulaire ouvert en hausse de 71% par rapport à la meilleure méthode antérieure.

L'intérêt tient à la mutualisation : plutôt que de faire tourner des pipelines séparés pour la géométrie, le rendu et la compréhension sémantique, ce qui multiplie mémoire et calcul embarqués, OREN-X fait cohabiter ces représentations et en tire une synergie mesurée, les estimations SDF étant affinées par les données d'occupation et de radiance. Pour l'autonomie longue durée des robots mobiles, cela répond à un frein concret à la mise en production : exécuter navigation, rendu visuel et compréhension de scène en langage naturel sans faire exploser la charge de calcul embarquée. Les gains en vocabulaire ouvert suggèrent un ancrage sémantique plus fiable sans sacrifier la vitesse, même si ces résultats restent obtenus en simulation sur Replica et non sur un robot physique en conditions réelles.

Ce travail s'inscrit dans une recherche où la cartographie robotique traitait jusqu'ici séparément les représentations SDF/TSDF pour la géométrie, les champs de radiance neuronaux ou le splatting gaussien pour le rendu, et des embeddings type CLIP pour l'ancrage sémantique, chacun avec son propre coût mémoire. OREN-X se positionne comme une alternative unifiée, appuyée sur un octree partagé et un parcours de rayons accéléré par GPU pour le rendu temps réel. Publié en preprint sur arXiv sans évaluation par les pairs à ce stade, l'article ne précise ni les auteurs ni de calendrier de tests sur robot réel ; il reste, pour l'instant, une contribution validée en simulation plutôt qu'un système prêt à l'intégration industrielle.

Dans nos dossiers

À lire aussi

OREN : réseau résiduel octree pour la cartographie en distance euclidienne signée en temps réel
1arXiv cs.RO 

OREN : réseau résiduel octree pour la cartographie en distance euclidienne signée en temps réel

Des chercheurs ont publié sur arXiv (réf. 2510.18999, version 2) OREN, pour Octree Residual Network, une méthode de reconstruction de fonctions de distance signée euclidienne (ESDF) en temps réel à partir de nuages de points 3D. L'architecture est hybride : une structure octree assure l'interpolation spatiale explicite, tandis qu'un réseau de neurones calcule le résidu implicite. L'objectif annoncé est un ESDF complet (non tronqué), différentiable, avec une empreinte mémoire et computationnelle comparable aux méthodes volumétriques discrètes classiques, et une précision proche des approches entièrement neurales. Des expériences extensives sur des jeux de données de référence sont citées à l'appui de ces affirmations. La carte de distance signée est une primitive fondamentale de l'autonomie robotique : elle conditionne la planification de trajectoire, le contrôle d'évitement de collision et le SLAM. Les méthodes en production restent majoritairement des TSDF (Truncated Signed Distance Field, comme VoxBlox) rapides et scalables mais tronqués à une bande de surface étroite et non différentiables ; les méthodes neurales pures (iSDF de Meta, approches NeRF-based) sont continues et précises mais souffrent d'oubli catastrophique dans les grands environnements et restent trop coûteuses pour l'embarqué temps-réel. Si les performances annoncées de OREN résistent à une validation indépendante, l'approche pourrait concrètement débloquer l'ESDF temps-réel pour des robots mobiles et manipulateurs opérant à grande échelle en environnements dynamiques, sans les compromis habituels. OREN s'inscrit dans une vague de méthodes hybrides cherchant à réconcilier efficacité des structures discrètes et expressivité neurale, aux côtés de travaux comme SHINE-Mapping ou NGLOD. Les représentations volumétriques comme OctoMap et OpenVDB dominent encore les déploiements industriels réels. Meta avait positionné iSDF en 2022 comme alternative neurale scalable ; depuis, plusieurs équipes de recherche travaillent à réduire les coûts d'inférence pour franchir le seuil du temps-réel embarqué. L'article est un preprint arXiv (v2, soumis en octobre 2025), sans peer-review finalisé et sans affiliation industrielle identifiée dans le résumé. Les prochaines étapes attendues incluent une évaluation sur des benchmarks standardisés tels que ScanNet ou SemanticKITTI, et une intégration dans des pipelines SLAM open-source pour confirmer les gains annoncés en conditions réelles.

RecherchePaper
1 source
Capteur cutané conforme pour la cartographie en temps réel de la forme
2arXiv cs.RO 

Capteur cutané conforme pour la cartographie en temps réel de la forme

Des chercheurs ont présenté sur arXiv (preprint 2605.01170, mai 2025) un capteur souple et conforme capable de reconstruire en temps réel la déformation tridimensionnelle d'une surface flexible, sans recourir à la vision. Le dispositif intègre un réseau 2D de jauges de contrainte imprimées à base d'indium-gallium eutectique oxydé (o-EGaIn), emboîtées en miroir dans un film élastomère. Un réseau de 5x5 capteurs espacés de 12 mm mesure les contraintes hors axe neutre, et un modèle d'observation informé par la mécanique des matériaux, couplé à une routine d'optimisation rapide, estime simultanément la courbure locale, l'élongation, le décalage et l'orientation. Le système atteint une erreur moyenne de reconstruction de surface de 0,62 mm avec une latence de 100 ms, testée sur des scénarios combinant étirement, flexion et indentation. Les démonstrations incluent le suivi de gestes de la paume, l'indentation par un doigt, et la déformation d'un ballon sous contact. Ce résultat est notable parce qu'il adresse une limitation structurelle des approches visuelles existantes : la nécessité d'une ligne de visée et d'une instrumentation complexe, incompatibles avec les environnements occultés ou à espace contraint, notamment la chirurgie mini-invasive, les prothèses ou les doigts de préhension robotique. La précision sub-millimétrique à 10 Hz ouvre un espace d'utilisation pour le suivi épidermique du mouvement, l'interaction haptique à retour de forme, et la surveillance peropératoire en temps réel, sans nécessiter de marqueurs externes ni de caméras. Il s'agit cependant d'un preprint académique : aucun produit n'est annoncé ni commercialisé. Les capteurs à base d'EGaIn liquide-métal sont étudiés depuis une décennie pour leur déformabilité et leur conductivité, mais la reconstruction 3D continue à partir de mesures de contraintes distribuées reste un problème ouvert. Les approches concurrentes incluent les capteurs à fibre optique (FBG), plus précis mais rigides et coûteux, et les peaux tactiles matricielles à base de matériaux piézorésistifs ou capacitifs. Ce travail se distingue par la combinaison d'une fabrication par impression, d'un modèle mécanique intégré et d'une latence compatible avec le contrôle en boucle fermée. Les prochaines étapes naturelles sont l'intégration sur un effecteur robotique souple ou un instrument chirurgical, et la tenue à l'autoclave pour la stérilisation.

RecherchePaper
1 source
VLEM : cartographie 3D vision-langage par embeddings en temps réel
3arXiv cs.RO 

VLEM : cartographie 3D vision-langage par embeddings en temps réel

Une équipe de chercheurs a publié une version révisée (v2) de l'article arXiv 2508.06291 présentant VLEM (Vision-Language Embedding Mapping), un système de cartographie sémantique 3D en temps réel qui fonctionne à partir d'un simple flux RGB-D brut, sans poses de caméra vérité terrain. Le framework fusionne des embeddings vision-langage 2D alignés au pixel, issus de différents modèles vision-langage, dans une représentation 3D globalement cohérente et métriquement précise. Comparé à trois systèmes existants, ConceptFusion, Open-Fusion et RayFronts, VLEM affiche de meilleures performances en segmentation en vocabulaire ouvert et une représentation plus compacte en mémoire. Les auteurs démontrent aussi son usage sur des tâches de manipulation robotique interactive en temps réel et sur des scénarios de cartographie mobile. La compréhension sémantique de scène en robotique exige des représentations à la fois précises au sens métrique et interrogeables en langage naturel en temps réel, combinaison que les modèles vision-langage peinent à tenir une fois intégrés à un pipeline 3D, freinés par le coût de calcul, les contraintes mémoire et la dépendance habituelle à des poses caméra vérité terrain rarement disponibles hors laboratoire. En s'appuyant uniquement sur un flux RGB-D brut, VLEM lève ce verrou et rapproche cette cartographie sémantique d'un déploiement robotique réel, hors environnement instrumenté. Pour les équipes de recherche en manipulation ou en navigation mobile, cela ouvre la voie à des robots interrogeables en langage naturel directement sur une carte 3D construite à la volée. La comparaison à ConceptFusion, Open-Fusion et RayFronts reste un benchmark choisi par les auteurs, à confirmer par des évaluations indépendantes. VLEM s'inscrit dans la lignée des travaux combinant modèles vision-langage type CLIP et pipelines de SLAM pour doter les robots d'une compréhension du monde interrogeable en langage naturel, citant explicitement ConceptFusion, Open-Fusion et RayFronts comme repères directs plutôt qu'une rupture inédite. Il s'agit à ce stade d'une publication de recherche en preprint sur arXiv, sans produit, partenariat industriel ni calendrier de déploiement annoncés ; la mention "replace" signale une révision d'une soumission initiale. La suite attendue pour ce type de travail est la publication du code et une évaluation communautaire sur des jeux de données standardisés, avant une éventuelle reprise par des acteurs commerciaux de la robotique.

RecherchePaper
1 source
PRISM : cartographie multimodale de terrain pour la navigation d'un rover en environnement non structuré
4arXiv cs.RO 

PRISM : cartographie multimodale de terrain pour la navigation d'un rover en environnement non structuré

Des chercheurs présentent PRISM, un système de perception multimodale destiné à la cartographie de terrain pour la navigation de rovers en environnements non structurés, dans un article publié sur arXiv (2607.16366v1). Le système s'appuie sur une suite de capteurs personnalisée capturant simultanément des images RGB, de profondeur et thermiques alignées, format noté RGB-D-T. Son cœur algorithmique, baptisé OmniUnet, est un réseau basé sur les vision transformers, conçu spécifiquement pour la segmentation sémantique multimodale de terrain. Les auteurs ont validé leur approche sur deux jeux de données inédits, BASEPROD et LAENTIEC, annotés pour l'occasion, puis testé le système lors d'expériences de terrain réelles. Point notable, PRISM tourne sur un calculateur embarqué aux ressources limitées et génère des cartes de franchissabilité directement exploitables par le sous-système de guidage, navigation et contrôle (GNC) du rover. L'intérêt principal de ces travaux réside dans l'ajout de l'imagerie thermique aux capteurs optiques et de profondeur classiques, une combinaison qui améliore la différenciation des types de terrain, notamment dans des conditions où la seule vision RGB-D peine (faible luminosité, ombres, poussière, végétation ambiguë). Pour l'industrie de la robotique de terrain, planétaire ou tout-terrain, cela répond à un vrai point de friction : la fiabilité de la cartographie de franchissabilité conditionne directement la sécurité de navigation autonome sur pentes raides ou sols rocheux. Le fait que le pipeline complet, capteurs, réseau de segmentation et génération de carte, fonctionne sur du matériel embarqué contraint constitue une démonstration concrète de faisabilité, plutôt qu'une simple preuve de concept en simulation, ce qui distingue ce travail d'approches purement académiques limitées au laboratoire. Ce papier s'inscrit dans une tendance plus large de fusion de capteurs pour la perception robotique en extérieur, où les systèmes purement RGB-D montrent des limites face à la diversité des textures et éclairages du terrain naturel. Contrairement à des annonces de robots humanoïdes très médiatisées, il s'agit ici d'une contribution académique (preprint arXiv, non encore relu par les pairs) centrée sur les rovers et véhicules autonomes tout-terrain, un segment où les acteurs de référence restent les programmes d'exploration planétaire et la robotique de défense ou agricole. Les prochaines étapes attendues concernent l'extension des jeux de données et des essais terrain supplémentaires pour confirmer la robustesse du système dans des conditions plus variées.

RecherchePaper
1 source