Aller au contenu principal
ActiveLang : cartographie 3D active à vocabulaire ouvert, avec exploration guidée par l'incertitude sémantique
RecherchearXiv cs.RO 

ActiveLang : cartographie 3D active à vocabulaire ouvert, avec exploration guidée par l'incertitude sémantique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ActiveLang est un système autonome de cartographie 3D active à vocabulaire ouvert, décrit dans un preprint arXiv (2610.09518). Il construit des cartes 3D annotées en langage naturel pendant que le robot explore, et choisit lui-même où regarder ensuite en fonction de l'incertitude sémantique. Techniquement, le système adapte en ligne des descripteurs de langage sur une représentation compacte à double jeu de gaussiennes (variante du Gaussian Splatting). Cette représentation reconstruit conjointement la géométrie, l'apparence et la sémantique, avec un surcoût mémoire que les auteurs qualifient de modeste, sans le chiffrer dans le résumé. Le planificateur sélectionne les points de vue les plus informatifs, ce qui permet de cartographier avec moins d'observations et un coût de calcul réduit. Les tests portent sur deux jeux de données, Replica et ScanNet++. Ils montrent des gains « substantiels » en segmentation à vocabulaire ouvert, en 2D comme en 3D, face à des méthodes en ligne et hors ligne. Le résumé ne donne ni pourcentages de mIoU, ni temps de calcul, ni nombre de vues économisées.

L'enjeu est de savoir quoi regarder, pas seulement comment représenter ce qu'on a vu. La plupart des cartes sémantiques à vocabulaire ouvert supposent un parcours de capture déjà fait, puis traité hors ligne. Un robot déployé dans un entrepôt, un hôpital ou un domicile ne connaît ni l'environnement ni les concepts utiles à l'avance. Il doit donc cartographier et interpréter en même temps. Si l'approche tient ses promesses, elle réduit le temps d'exploration et le calcul embarqué, deux postes qui pèsent sur la viabilité d'un déploiement. Elle permettrait aussi d'interroger la carte en langage libre (« où est le chariot rouge ? ») sans réentraîner de classifieur. Les réserves sont nettes. Replica et ScanNet++ sont des scènes d'intérieur statiques et propres, et aucune validation sur robot réel, avec bruit de capteur, dynamique ou grandes surfaces, n'est mentionnée dans le résumé. C'est un résultat de recherche, pas un produit.

Le travail s'inscrit dans la convergence entre le Gaussian Splatting et les modèles vision-langage, avec des approches comme LangSplat ou Feature 3DGS pour la distillation de caractéristiques CLIP dans des scènes 3D. Ces méthodes restent souvent hors ligne et passives. À l'inverse, la cartographie active, historiquement fondée sur l'information géométrique (exploration par frontières, prochaine meilleure vue), n'intégrait pas l'incertitude sémantique. ActiveLang comble cet écart. Les prochaines étapes à surveiller sont un passage sur plateforme mobile réelle, des mesures de latence embarquée et une intégration avec des planificateurs de tâches pilotés par modèles de langage. Aucun partenaire industriel ni calendrier n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense
1arXiv cs.RO 

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense

Des chercheurs ont publié une nouvelle version (v2) de l'article arXiv 2407.09016, qui présente OVExp, un framework d'exploration en vocabulaire ouvert pour la navigation robotique vers des objets-cibles non catégorisés au préalable. Le système s'appuie sur des modèles Dense CLIP pour généraliser la cartographie sémantique, sans recourir à l'inférence coûteuse de grands modèles de langage (LLM) ni à un entraînement intensif par apprentissage par renforcement (RL) de bout en bout. L'innovation centrale est une stratégie de transfert cross-modal sur cartographie sémantique : le réseau apprend d'abord uniquement à partir de texte, puis transfère ces représentations, au moment du test, vers une cartographie multimodale combinant localisation spatiale précise des objets et représentations visuelles généralisables. Les auteurs annoncent une généralisation robuste vers des objets-cibles inédits, validée sur les benchmarks établis d'ObjectNav, malgré un entraînement reposant sur des mises en page textuelles limitées en nombre d'objets. Pour l'industrie robotique et les intégrateurs, ce travail cible un problème concret de coût et de latence : les approches actuelles de navigation en vocabulaire ouvert, qui appellent un LLM à chaque décision ou nécessitent des heures d'entraînement RL par environnement, restent difficiles à déployer à grande échelle sur des robots mobiles autonomes (AMR) ou des plateformes d'inspection. En montrant qu'un réseau de prédiction d'objectifs basé sur une carte sémantique peut généraliser sans réentraînement lourd ni appel LLM en boucle, OVExp propose une alternative aux architectures VLA gourmandes en ressources, ce qui intéresse directement tout acteur cherchant à doter des robots de capacités de recherche d'objets flexibles sans exploser les coûts d'inférence en production. Ce travail s'inscrit dans la lignée des recherches sur ObjectNav, la tâche de navigation vers un objet-cible désigné par catégorie ou par image dans un environnement inconnu, un benchmark phare de la navigation embarquée depuis plusieurs années. Il se positionne face à deux familles de méthodes concurrentes : celles qui exploitent des LLM sans entraînement supplémentaire pour raisonner sur la scène, coûteuses en inférence, et celles qui affinent des politiques par RL de bout en bout, limitées en généralisation hors distribution. En s'appuyant sur CLIP, déjà largement utilisé pour l'ancrage vision-langage, et sur un entraînement texte-seul transférable au moment du test, les auteurs proposent une voie plus économe en ressources. Publié en v2 sur arXiv, l'article reste à ce stade une contribution académique évaluée en simulation, sans annonce de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source
FUS3DMaps : cartographie sémantique à vocabulaire ouvert par fusion 3D de couches voxel et instance
2arXiv cs.RO 

FUS3DMaps : cartographie sémantique à vocabulaire ouvert par fusion 3D de couches voxel et instance

Une équipe de recherche a publié le 6 mai 2026 sur arXiv (référence 2605.03669) FUS3DMaps, une méthode de cartographie sémantique 3D à vocabulaire ouvert conçue pour permettre à des robots de localiser spatialement des concepts arbitraires sans ensemble de classes prédéfini. Le système fonctionne en ligne et maintient simultanément deux couches sémantiques dans une même carte de voxels partagée : une couche dense, qui projette directement les embeddings de pixels sur la carte 3D, et une couche instance-level, qui segmente les vues, encode les régions correspondant à des objets distincts, puis les associe en 3D. Les expériences menées sur des benchmarks établis de segmentation sémantique 3D montrent que FUS3DMaps atteint une précision compétitive à l'échelle de bâtiments multi-étages, un niveau de scalabilité rarement démontré pour ce type d'approche sans entraînement supervisé. Le code et les données complémentaires sont annoncés en accès ouvert. Ce qui distingue FUS3DMaps des méthodes existantes est la fusion sémantique inter-couches (cross-layer fusion), qui combine les forces complémentaires des deux représentations : la couche dense couvre l'intégralité du champ visuel sans nécessiter de segmentation préalable, mais souffre d'un manque de précision à l'échelle ; la couche instance-level est précise sur les objets individuels mais dépend de l'association 2D-3D. En fusionnant les embeddings des deux couches au niveau voxel, la méthode améliore la qualité de chacune. Pour garantir la scalabilité, la fusion dense et inter-couches est restreinte à une fenêtre spatiale glissante, évitant l'explosion mémoire dans les grands environnements. Pour les intégrateurs de robotique mobile ou les développeurs de systèmes de navigation en environnement ouvert, c'est une piste concrète vers des robots capables de répondre à des requêtes en langage naturel sur des espaces non balisés. La cartographie sémantique à vocabulaire ouvert est un champ en plein essor depuis l'émergence des vision-language models (VLM) comme CLIP. Les approches actuelles se divisent en deux familles : les méthodes instance-level (LSeg, OpenScene, EmbodiedScan) et les méthodes dense (ConceptFusion, OpenFusion), chacune avec ses compromis entre précision et scalabilité. FUS3DMaps tente de réconcilier les deux dans un pipeline unifié, sans fine-tuning. À noter que l'article est une prépublication arXiv, sans validation par les pairs à ce stade, et que les démonstrations vidéo et le code sont encore annoncés comme "à venir". Aucune entreprise industrielle ou partenaire de déploiement n'est mentionné : il s'agit d'une contribution de recherche académique, pas d'un produit commercialisé.

RechercheActu
1 source
CrossMaps : cartographie sémantique à vocabulaire ouvert avec estimation de confiance pour la navigation de rovers
3arXiv cs.RO 

CrossMaps : cartographie sémantique à vocabulaire ouvert avec estimation de confiance pour la navigation de rovers

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (identifiant 2606.16935) les travaux relatifs à CrossMaps, un pipeline de cartographie sémantique en temps réel conçu pour la navigation de rovers autonomes. Le système exploite des données RGB-D pour construire des cartes interrogeables en langage naturel, en s'appuyant sur des embeddings CLIP multi-échelles fusionnés avec un mécanisme de pondération par confiance. L'architecture repose sur une mémoire duale : une mémoire court terme (STM) qui agrège les observations visuelles bruitées en combinant des métriques de confiance géométrique, sémantique et temporelle, et une mémoire long terme (LTM) dans laquelle sont promus les points d'intérêt stables et cohérents, constituant ainsi des repères sémantiques persistants. Le système est dimensionné pour fonctionner sur un UGV équipé d'un module Jetson Orin de NVIDIA, couplé à un pipeline SLAM, et génère des cartes de chaleur sémantiques interrogeables par requêtes en langage naturel. L'intérêt de CrossMaps réside dans sa gestion explicite de la qualité perceptive, fiabilité du capteur de profondeur, artefacts d'éclairage, densité des données, directement intégrée dans la représentation spatiale, un aspect souvent traité de façon ad hoc dans les systèmes concurrents. En distinguant observations transitoires et connaissances consolidées via la dualité STM/LTM, l'architecture vise à réduire le gap sim-to-real classique des systèmes de navigation sémantique déployés en conditions dégradées. Pour un intégrateur ou un responsable de flotte robotique, cela signifie potentiellement une navigation plus robuste dans des environnements industriels non-structurés sans nécessiter un réentraînement des modèles pour chaque nouveau vocabulaire d'objets. CrossMaps s'inscrit dans la lignée directe des VLMaps (travaux de Huang et al., 2023), qui ont popularisé la fusion de caractéristiques CLIP dans des cartes spatiales 3D pour la navigation en langage naturel. La différence revendiquée ici est la couche de gestion de la confiance et la séparation mémoire court/long terme, absentes dans VLMaps. L'article reste un preprint non encore évalué par les pairs, et les performances réelles sur un UGV physique en dehors de conditions contrôlées ne sont pas détaillées dans l'abstract, un point à vérifier dans le corps du papier avant toute extrapolation industrielle. Les suites naturelles incluent une comparaison quantitative face à ConceptFusion ou LERF, et un déploiement en environnements extérieurs non-structurés.

RecherchePaper
1 source
Cartographie prédictive sémantique pour l'exploration et la navigation
4arXiv cs.RO 

Cartographie prédictive sémantique pour l'exploration et la navigation

Une équipe de chercheurs publie sur arXiv (2610.10382) une étude sur la cartographie prédictive sémantique pour l'exploration et la navigation robotique. Leur point de départ : les cartes d'occupation seules, qui estiment les zones non observées à partir d'observations partielles, ne distinguent pas des structures sémantiquement différentes mais géométriquement proches. Une porte intérieure apparaît ainsi comme une cellule occupée, au même titre qu'un mur, alors qu'elle signale une pièce ou un couloir au-delà de la zone observée. Pour tester l'effet d'un indice sémantique, les auteurs modifient un sous-ensemble du jeu de données CogniPlan en insérant des ambiguïtés liées aux portes dans les cartes d'occupation partielles, sans toucher aux cartes de référence. Ils comparent deux modèles entraînés sur ces mêmes données : un modèle témoin purement géométrique et un modèle à indice sémantique, qui reçoit un canal supplémentaire dédié aux portes. L'évaluation repose sur l'erreur L1, le score F1 et l'intersection sur union (IoU), mesurés sur la carte entière puis sur un masque de 10 pixels autour des portes. Sur la carte entière, les deux modèles restent proches. Dans la zone des portes, l'erreur L1 passe de 0,004342 à 0,000025, tandis que le F1 et l'IoU passent de 0,031311 et 0,015905 à 1,000000 chacun. Pour les intégrateurs et les équipes qui déploient des robots mobiles en intérieur (bâtiments, entrepôts, hôpitaux), le résultat va dans le sens d'une intuition répandue : la géométrie seule laisse des angles morts exploitables, et un signal sémantique léger suffit à les combler localement. Un robot qui sait qu'une cellule occupée est une porte peut anticiper ce qui se trouve derrière et planifier son exploration en conséquence, ce qui compte pour la cartographie autonome et la recherche de cibles. Il faut cependant lire les chiffres avec prudence. Un F1 et un IoU de 1,0 sur le masque des portes indiquent que la tâche est ici quasi triviale : les ambiguïtés ont été injectées artificiellement dans des cartes simulées, et le modèle reçoit en entrée la position exacte des portes. Le gain est donc une borne haute obtenue en conditions idéales. Il ne dit rien de la robustesse face à des portes détectées par perception réelle, avec bruit, faux positifs et portes fermées ou entrouvertes. L'absence d'amélioration sur la carte entière montre aussi que l'effet reste très localisé. Ce travail s'appuie sur CogniPlan, un cadre de planification d'exploration reposant sur la prédiction de cartes, dont il reprend les données. Il s'inscrit dans un courant plus large qui cherche à intégrer des cartes sémantiques et des modèles de perception dans la planification de trajectoire, en concurrence avec des approches fondées sur de grands modèles de vision et langage pour le raisonnement spatial. Les prochaines étapes logiques sont de remplacer l'indice de porte fourni par un détecteur appris, de tester sur des environnements réels et d'étendre l'approche à d'autres classes sémantiques (escaliers, ascenseurs, vitres). Aucun déploiement ni calendrier n'est annoncé : il s'agit à ce stade d'une preuve de concept de recherche, sans produit associé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source