NaviRrator : la navigation du robot à partir de cartes lisibles par l'humain, guidée par un itinéraire visuel appris
Des chercheurs présentent NaViRRator, un système qui traduit un point de départ et une destination désignés sur une carte lisible par un humain en instructions de navigation pour une politique de navigation vision-langage (VLN) déjà entraînée. Decrit dans un preprint mis en ligne sur arXiv le 21 septembre 2026 (2609.21316), il repose sur RouteScribe, une méthode qui sépare l'inférence de trajectoire de sa formulation en langage. RouteScribe génère d'abord un squelette de route dans les coordonnées de l'image de carte, via une technique nommée SGL-CFM qui déformé une ligne droite entre départ et arrivée pour épouser la géométrie du lieu, puis un modèle vision-langage pré-entraine convertit ce squelette en instruction textuelle. En tests réels, le système obtient des taux de réussite et des scores SPL (success weighted by path length) supérieurs a trois méthodes de référence : génération directe carte-vers-instruction, squelette calcule par l'algorithme A*, et flow matching a source gaussienne.
L'enjeu concret touche un goulot d'étranglement bien connu du déploiement de robots mobiles autonomes en entrepôt ou en bâtiment industriel : relier la géométrie schématique d'un plan aux observations a hauteur de robot. En gardant la carte et le squelette de route en amont, hors du module exécuteur, l'architecture permet de changer de politique VLN sans reentrainer les modules qui relient carte et langage, un atout pour des intégrateurs qui assemblent des briques logicielles distinctes. Les résultats vont a l'encontre de l'idée qu'une génération directe d'instructions depuis la carte suffirait : l'ancrage explicite de la route améliore la clarté des virages saillants et la fidélité de la séquence de manoeuvres voulue.
NaViRRator reste, a ce stade, une contribution de recherche publiée en preprint, sans acteur industriel, produit commercial, site de déploiement ni pilote annonces dans l'article : il s'agit d'une démonstration en environnement réel contrôle, non d'une mise en production. Le travail s'inscrit dans la lignée des politiques de navigation vision-langage pré-entraînées, traitées ici comme des exécuteurs interchangeables places en aval d'un pipeline carte-vers-instruction, une logique modulaire proche des approches vision-langage-action qui structurent aujourd'hui la robotique mobile et manipulatrice, mais appliquée spécifiquement a la navigation. Aucune date de suite, de financement ou de transfert vers un produit n'est précisée, ce qui situe cette publication comme une preuve de concept méthodologique plutôt qu'une annonce commerciale.
Dans nos dossiers



