SPAN-Nav : une conscience spatiale généralisée pour la navigation incarnée polyvalente
SPAN-Nav est un modèle de fondation de bout en bout, décrit dans une version révisée (v2) de l'article arXiv 2603.09163, qui vise à doter la navigation incarnée d'une perception 3D universelle à partir de simples flux vidéo RGB. Les chercheurs entraînent le modèle sur une tâche de prédiction d'occupation, c'est-à-dire d'estimation des zones libres et occupées de l'espace, dans de nombreux environnements intérieurs et extérieurs. Pour limiter le coût de calcul, ils compressent ces connaissances spatiales en un unique token, qu'ils jugent suffisant pour porter les indices grossiers utiles à la navigation. Ce token est ensuite injecté explicitement dans le raisonnement sur les actions, selon une logique inspirée de la chaîne de pensée (Chain-of-Thought). L'équipe publie aussi un jeu de données de 4,2 millions d'annotations d'occupation couvrant l'intérieur et l'extérieur, ainsi que plusieurs types de tâches de navigation. Le modèle revendique l'état de l'art sur trois benchmarks et des essais en conditions réelles.
L'intérêt tient à un point faible bien identifié des approches de navigation fondées sur les modèles vision-langage (VLM). Ces modèles généralisent bien en navigation guidée par le langage (VLN), mais leur planification de trajectoire se dégrade dans les environnements complexes, faute de compréhension géométrique fiable. Montrer qu'un seul token spatial suffit à corriger une partie de ce défaut est un résultat utile pour les intégrateurs: cela suggère qu'on peut gagner en robustesse sans capteurs 3D dédiés ni surcoût de calcul prohibitif sur des plateformes embarquées, avec une simple caméra RGB. L'entraînement multitâche semble aussi transférer ces acquis à des tâches sans supervision spatiale explicite. Il faut toutefois rester prudent: l'article ne donne pas, dans ce résumé, de chiffres de gain, de noms de benchmarks ni de plateformes robotiques. Le fossé entre résultats académiques et déploiement reste donc à évaluer, et les tests réels décrits n'ont pas de protocole détaillé.
Ce travail s'inscrit dans la montée des modèles vision-langage-action (VLA) et des VLM appliqués à la navigation, qui héritent de leur généralisation sémantique mais pas de leur sens de l'espace. Plusieurs équipes cherchent à y remédier en ajoutant des représentations 3D, des cartes d'occupation ou des modules de profondeur, souvent au prix d'architectures plus lourdes. SPAN-Nav se distingue par sa compacité et son intégration de bout en bout. La suite dépendra de la disponibilité du jeu de données et du code, de la reproduction des résultats par des tiers et de tests sur des robots mobiles, quadrupèdes ou humanoïdes en environnement industriel. Aucun pilote commercial ni calendrier n'est annoncé à ce stade.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




