Navi-Agent : agent de navigation monoculaire sans localisation
Un article publié sur arXiv (2609.20388) présente Navi-Agent, un agent de navigation zero-shot pour la Vision-Language Navigation in Continuous Environments (VLN-CE), où un robot doit suivre des instructions en langage naturel dans un environnement inconnu, sans carte préétablie. Face aux systèmes classiques qui s'appuient sur une localisation géométrique ou des coordonnées, et aux approches récentes sans profondeur ni coordonnées globales mais incapables de garder une mémoire spatiale fiable, Navi-Agent construit un état spatial sans coordonnées à partir d'une seule caméra et de l'historique des déplacements exécutés, organisé en topologie où les nœuds sont des lieux visuels et les arêtes des transitions de mouvement. En boucle fermée, il découpe une instruction en sous-objectifs, navigue localement par vision, puis vérifie les lieux visités via cette topologie pour s'auto-localiser, suivre sa progression et se rétablir par revisite visuelle en cas d'erreur. Les auteurs l'évaluent sur un benchmark VLN-CE zero-shot et sur des plateformes robotiques réelles.
L'enjeu pour les intégrateurs de robotique est concret: le système fonctionne avec une seule caméra RGB, sans capteur de profondeur ni odométrie globale, ce qui allège le coût matériel et la dépendance à un SLAM classique en environnement inconnu. Il répond à un point faible connu des architectures dites geometry-free, qui abandonnent les coordonnées mais perdent la capacité à confirmer qu'un lieu a déjà été visité ou à se rétablir après une erreur de trajectoire. Les auteurs revendiquent l'état de l'art parmi les méthodes sans contrainte géométrique et une compétitivité avec les approches à localisation géométrique classique, mais le résumé ne détaille ni taux de réussite ni conditions des essais réels, ce qui invite à la prudence sur la portée de cette comparaison.
Ce travail s'inscrit dans la recherche active en VLN-CE, qui vise à faire suivre des instructions naturelles à un agent dans un espace 3D continu plutôt qu'un graphe discret préconstruit. Il se positionne contre les méthodes à coordonnées globales, précises mais coûteuses en capteurs, et contre les approches geometry-free qui n'ont pas résolu la persistance spatiale. Classé comme nouvelle soumission arXiv, le papier ne cite ni entreprise ni laboratoire affilié, ni date de publication de code.
Dans nos dossiers




