
SparseNav : perception sémantique sparse conditionnée par instruction pour la navigation vision-langage sans entraînement
SparseNav, un système de navigation vision-langage sans entraînement, vient d'être présenté dans un article publié sur arXiv (référence 2609.26408v1). Le framework s'appuie sur un principe de sobriété perceptive plutôt que d'accumulation systématique de sémantique. Il maintient une carte géométrique légère en vue aérienne (BEV) et une mémoire éparse de repères, alimentée uniquement à la demande selon la sous-instruction active. Un gestionnaire d'instructions suit la progression et identifie le repère recherché, puis un mécanisme de perception conditionné par l'instruction déclenche une segmentation à vocabulaire ouvert seulement quand ce repère est visible et que sa position peut orienter la décision suivante. Sans aucun entraînement supplémentaire, SparseNav atteint 42,8% de taux de réussite sur le benchmark R2R-CE et 40,7% sur RxR-CE, sur les splits Val-Unseen. L'équipe l'a aussi déployé sur un robot quadrupède Unitree Go2, équipé d'une caméra RGB-D Intel RealSense D455 pour la cartographie géométrique et l'ancrage des repères, et d'un LiDAR Livox MID-360 pour la localisation, sans carte préconstruite, validant l'approche dans plusieurs environnements intérieurs.
L'intérêt pour l'industrie robotique tient au fait que SparseNav évite l'écueil classique des méthodes de VLN basées sur des cartes: accumuler des objets et annotations non pertinents, ce qui alourdit le calcul et brouille la représentation visuo-spatiale exploitée par le modèle vision-langage planificateur. En s'affranchissant de tout entraînement dédié, l'approche réduit le coût d'intégration pour les équipes robotiques qui veulent déployer de la navigation instruite en langage naturel sans pipeline de fine-tuning ni cartographie sémantique dense préalable. Le passage réussi d'un banc d'essai en simulation à un robot réel sans carte préconstruite illustre une piste concrète pour réduire l'écart simulation-réel qui freine encore l'adoption de la navigation VLN en conditions industrielles ou logistiques.
Ce travail s'inscrit dans la lignée des recherches sur la navigation vision-langage en environnement continu, un champ où les cartes sémantiques exhaustives sont la norme mais où leur coût de calcul et de maintenance reste un frein. Les benchmarks R2R-CE et RxR-CE servent de référence standard pour comparer ces approches, généralement plus gourmandes en entraînement ou en annotation. Les auteurs présentent des ablations contrôlées pour isoler la contribution de chaque composant du framework, et la démonstration sur Unitree Go2 laisse entrevoir des tests élargis à d'autres plateformes et environnements comme prochaine étape logique.
Dans nos dossiers




