RiverVLN : navigation vision-langage temporelle ancrée par phases pour véhicules de surface sans pilote
Un groupe de recherche publie RiverVLN, présenté comme le premier benchmark dédié à la navigation vision-langage (VLN) longue portée pour véhicules de surface sans pilote (USV) évoluant en mouvement continu sur des rivières, accompagné du framework PGT-NAV. Plutôt que de faire correspondre directement une instruction complète à une trajectoire, PGT-NAV découpe l'instruction en une séquence ordonnée de phases sémantiques vérifiables visuellement, et maintient en ligne la phase active grâce à des preuves visuelles et de mouvement. Cet état de progression est fusionné avec l'historique visuel-moteur et un ancrage spécifique à chaque phase pour prédire six incréments de pose locale en SE(2). Le système fonctionne selon une boucle prédiction-exécution-réobservation, où le navire avance vers un point cible, met à jour sa phase et son ancrage, puis replanifie via une couche de sécurité fondée sur une carte. En simulation fermée Unity-ROS, PGT-NAV atteint un taux de réussite moyen de 0,79 et réduit nettement la dérive cumulative de position et de cap par rapport à des références de type GNM et ViNT. Des essais sur des scénarios d'ouverture de pont non vus à l'entraînement, ainsi que des expériences sur USV réel, confirment un transfert de la performance simulée vers un déploiement physique.
L'intérêt de ces travaux tient à ce qu'ils déplacent la navigation vision-langage hors de son terrain habituel, les robots d'intérieur ou terrestres, où le langage sert de but statique et le déplacement se résume à des actions discrètes quasi instantanées. Sur une rivière, l'inertie, la manœuvrabilité limitée et la rareté de repères maritimes visuellement ambigus rendent ces hypothèses caduques. En démontrant qu'un ancrage temporel par phases peut tenir sous contrainte de mouvement continu, l'étude ouvre une piste concrète pour l'automatisation fluviale et maritime, l'inspection de voies navigables ou la logistique portuaire, des domaines où les modèles VLA conçus pour l'intérieur échouent généralement.
Ce travail s'inscrit dans la lignée des modèles de navigation par apprentissage comme GNM et ViNT, ici utilisés comme lignes de base comparatives plutôt que comme solutions retenues. Il s'agit d'un preprint arXiv, donc d'une contribution de recherche non encore validée par les pairs, et non d'un produit commercial ou d'un déploiement opérationnel à grande échelle. Les auteurs annoncent des essais réels sur USV comme prochaine étape de validation, sans calendrier de mise en production précisé.
Dans nos dossiers




