
ActiveLang : cartographie 3D active à vocabulaire ouvert, avec exploration guidée par l'incertitude sémantique
ActiveLang est un système autonome de cartographie 3D active à vocabulaire ouvert, décrit dans un preprint arXiv (2610.09518). Il construit des cartes 3D annotées en langage naturel pendant que le robot explore, et choisit lui-même où regarder ensuite en fonction de l'incertitude sémantique. Techniquement, le système adapte en ligne des descripteurs de langage sur une représentation compacte à double jeu de gaussiennes (variante du Gaussian Splatting). Cette représentation reconstruit conjointement la géométrie, l'apparence et la sémantique, avec un surcoût mémoire que les auteurs qualifient de modeste, sans le chiffrer dans le résumé. Le planificateur sélectionne les points de vue les plus informatifs, ce qui permet de cartographier avec moins d'observations et un coût de calcul réduit. Les tests portent sur deux jeux de données, Replica et ScanNet++. Ils montrent des gains « substantiels » en segmentation à vocabulaire ouvert, en 2D comme en 3D, face à des méthodes en ligne et hors ligne. Le résumé ne donne ni pourcentages de mIoU, ni temps de calcul, ni nombre de vues économisées.
L'enjeu est de savoir quoi regarder, pas seulement comment représenter ce qu'on a vu. La plupart des cartes sémantiques à vocabulaire ouvert supposent un parcours de capture déjà fait, puis traité hors ligne. Un robot déployé dans un entrepôt, un hôpital ou un domicile ne connaît ni l'environnement ni les concepts utiles à l'avance. Il doit donc cartographier et interpréter en même temps. Si l'approche tient ses promesses, elle réduit le temps d'exploration et le calcul embarqué, deux postes qui pèsent sur la viabilité d'un déploiement. Elle permettrait aussi d'interroger la carte en langage libre (« où est le chariot rouge ? ») sans réentraîner de classifieur. Les réserves sont nettes. Replica et ScanNet++ sont des scènes d'intérieur statiques et propres, et aucune validation sur robot réel, avec bruit de capteur, dynamique ou grandes surfaces, n'est mentionnée dans le résumé. C'est un résultat de recherche, pas un produit.
Le travail s'inscrit dans la convergence entre le Gaussian Splatting et les modèles vision-langage, avec des approches comme LangSplat ou Feature 3DGS pour la distillation de caractéristiques CLIP dans des scènes 3D. Ces méthodes restent souvent hors ligne et passives. À l'inverse, la cartographie active, historiquement fondée sur l'information géométrique (exploration par frontières, prochaine meilleure vue), n'intégrait pas l'incertitude sémantique. ActiveLang comble cet écart. Les prochaines étapes à surveiller sont un passage sur plateforme mobile réelle, des mesures de latence embarquée et une intégration avec des planificateurs de tâches pilotés par modèles de langage. Aucun partenaire industriel ni calendrier n'est annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




