Aller au contenu principal
RecherchearXiv cs.RO 

RiverVLN : navigation vision-langage temporelle ancrée par phases pour véhicules de surface sans pilote

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un groupe de recherche publie RiverVLN, présenté comme le premier benchmark dédié à la navigation vision-langage (VLN) longue portée pour véhicules de surface sans pilote (USV) évoluant en mouvement continu sur des rivières, accompagné du framework PGT-NAV. Plutôt que de faire correspondre directement une instruction complète à une trajectoire, PGT-NAV découpe l'instruction en une séquence ordonnée de phases sémantiques vérifiables visuellement, et maintient en ligne la phase active grâce à des preuves visuelles et de mouvement. Cet état de progression est fusionné avec l'historique visuel-moteur et un ancrage spécifique à chaque phase pour prédire six incréments de pose locale en SE(2). Le système fonctionne selon une boucle prédiction-exécution-réobservation, où le navire avance vers un point cible, met à jour sa phase et son ancrage, puis replanifie via une couche de sécurité fondée sur une carte. En simulation fermée Unity-ROS, PGT-NAV atteint un taux de réussite moyen de 0,79 et réduit nettement la dérive cumulative de position et de cap par rapport à des références de type GNM et ViNT. Des essais sur des scénarios d'ouverture de pont non vus à l'entraînement, ainsi que des expériences sur USV réel, confirment un transfert de la performance simulée vers un déploiement physique.

L'intérêt de ces travaux tient à ce qu'ils déplacent la navigation vision-langage hors de son terrain habituel, les robots d'intérieur ou terrestres, où le langage sert de but statique et le déplacement se résume à des actions discrètes quasi instantanées. Sur une rivière, l'inertie, la manœuvrabilité limitée et la rareté de repères maritimes visuellement ambigus rendent ces hypothèses caduques. En démontrant qu'un ancrage temporel par phases peut tenir sous contrainte de mouvement continu, l'étude ouvre une piste concrète pour l'automatisation fluviale et maritime, l'inspection de voies navigables ou la logistique portuaire, des domaines où les modèles VLA conçus pour l'intérieur échouent généralement.

Ce travail s'inscrit dans la lignée des modèles de navigation par apprentissage comme GNM et ViNT, ici utilisés comme lignes de base comparatives plutôt que comme solutions retenues. Il s'agit d'un preprint arXiv, donc d'une contribution de recherche non encore validée par les pairs, et non d'un produit commercial ou d'un déploiement opérationnel à grande échelle. Les auteurs annoncent des essais réels sur USV comme prochaine étape de validation, sans calendrier de mise en production précisé.

Dans nos dossiers

À lire aussi

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage
1arXiv cs.RO 

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage

Des chercheurs présentent ViTL (Vision-Language Temporal Logic), un système de navigation robotique capable d'exécuter des commandes en langage naturel impliquant plusieurs cibles et des contraintes temporelles, sans entraînement spécifique à l'environnement testé. Publié sur arXiv le 30 juin 2026, le framework s'attaque à un cas concret : une instruction comme "Nettoie la chaise ou le canapé, puis allume la télé" implique un ordre logique et un choix entre deux objets, ce qu'aucun système zero-shot existant ne gérait jusqu'ici. ViTL agit à deux niveaux. Au niveau tâche, un grand modèle de langage traduit la commande en formule de logique temporelle linéaire (LTL), convertie ensuite en automate fini déterministe (DFA) qui coordonne des cartes de valeur multi-canaux et déclenche une replanification dynamique dès qu'un nouvel objet pertinent est détecté. Au niveau navigation, les auteurs introduisent un "score directionnel" : plutôt qu'une valeur unique et indifférenciée sur tout le champ de vision, chaque direction de frontière est étiquetée sur l'image d'observation et notée séparément par le modèle vision-langage. Les tests ont été menés sur le simulateur Habitat-Matterport 3D (HM3D). L'enjeu dépasse la démonstration académique. Les méthodes actuelles de navigation zero-shot vers un objet, qui s'appuient sur des VLM pour guider une exploration par frontières dans un environnement inconnu, restent cantonnées à une seule cible à la fois. En prouvant qu'un pipeline LLM-vers-logique-vers-automate peut orchestrer plusieurs sous-tâches ordonnées sans réentraînement, ViTL déplace la limite de ce qu'un robot peut comprendre d'une instruction humaine complexe, un enjeu direct pour les intégrateurs qui déploient des robots domestiques ou logistiques devant suivre des consignes composites. Le score directionnel améliore aussi, selon les auteurs, la précision et l'efficacité sur les tâches à cible unique par rapport à leur référence de base, signe que le gain ne se limite pas aux scénarios multi-cibles. Ce travail s'inscrit dans la lignée des approches récentes combinant VLM et exploration frontalière pour la navigation sémantique zero-shot, une piste active depuis l'essor des modèles vision-langage capables de raisonner sur des scènes inconnues sans carte préexistante. La contribution spécifique de ViTL, la formalisation en logique temporelle plutôt qu'en heuristique ad hoc, ouvre la voie à des commandes encore plus complexes (conditions, boucles, contraintes de sécurité) dans de futurs travaux, même si le passage du simulateur HM3D à un robot réel reste l'étape non résolue par cette publication.

RecherchePaper
1 source
VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens
2arXiv cs.RO 

VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens

Une équipe de chercheurs a publié sur arXiv, le 18 septembre 2026 (référence 2609.20191), une étude décrivant "VLN on the Fly", une pile logicielle de navigation par instructions en langage naturel (vision-language navigation, VLN) fonctionnant intégralement à bord d'un robot aérien. Le système enchaîne quatre étages distincts et inspectables plutôt qu'un unique réseau de bout en bout : un modèle vision-langage (VLM) quantifié associe l'instruction textuelle à une cellule grossière de l'image caméra, la carte de profondeur convertit cette cellule en un objectif 3D, un planificateur de trajectoire rapide basé sur des splines B calcule un chemin faisable, puis une politique d'apprentissage par renforcement préentraînée traduit cette trajectoire en commandes moteur pour des quadricoptères. Sur 15 vols embarqués testant trois objets de référence du quotidien dans un volume intérieur contrôlé, le drone atteint sa cible dans 13 cas sur 15, avec une erreur moyenne de 5,72 cm par rapport à l'objectif et une utilisation moyenne du GPU embarqué de 39,3 %. Six essais supplémentaires en environnement encombré montrent des trajectoires sans collision grâce à un filtrage de la perception embarquée. L'intérêt de ces travaux tient à la contrainte de calcul propre aux drones, bien plus sévère que sur des robots au sol ou humanoïdes : grounding, planification et contrôle doivent se partager une puissance embarquée limitée, et une erreur dans un pipeline fusionné en un seul réseau (comme le font la plupart des politiques VLA de bout en bout) est difficile à isoler en vol. En conservant des étages séparés et observables, l'équipe défend une architecture plus sûre et plus facile à diagnostiquer, au prix probable d'une latence ou d'une flexibilité moindre qu'une politique end-to-end. Le chiffre de 39,3 % d'utilisation GPU suggère une marge de calcul disponible, preuve que l'exécution embarquée complète reste viable sans déport vers une station sol ou le cloud, un point clé pour les intégrateurs de drones d'inspection ou de logistique intéressés par un pilotage vocal ou textuel autonome. Il faut toutefois noter la portée limitée de la démonstration : 15 vols, trois objets, un environnement intérieur contrôlé, et un taux d'échec de 2 essais sur 15, loin d'un déploiement industriel validé. Ces travaux s'inscrivent dans le débat plus large opposant les architectures VLA de bout en bout, popularisées par des modèles comme Pi-0 ou GR00T N2 sur des plateformes au sol, à des pipelines modulaires jugés plus sûrs pour des systèmes critiques comme les drones volant à proximité d'humains ou d'obstacles. Aucun acteur français ou européen n'est mentionné dans cette étude, qui reste un prototype de recherche sans annonce de partenariat industriel ni de calendrier de déploiement commercial. Les essais en environnement encombré laissent entrevoir une prochaine étape vers des scénarios plus réalistes, mais aucun pilote opérationnel n'est pour l'instant annoncé.

RecherchePaper
1 source
Zéro pilote : ancrage métrique persistant pour la navigation aérienne vision-langage sans apprentissage
3arXiv cs.RO 

Zéro pilote : ancrage métrique persistant pour la navigation aérienne vision-langage sans apprentissage

Une équipe de recherche propose Fly0, un framework de navigation aérienne pilotée par instructions en langage naturel (Vision-Language Navigation, VLN) pour drones, décrit dans un article déposé sur arXiv (version révisée, arXiv:2602.15875v2) et dont le code est publié sur GitHub. Le système repose sur un pipeline en trois étapes qui découple le raisonnement sémantique de la planification géométrique : un modèle multimodal de grande taille (MLLM) traduit d'abord l'instruction textuelle en coordonnées de pixels 2D dans l'image, un module de projection géométrique exploite ensuite les données de profondeur pour localiser la cible en 3D, puis un planificateur géométrique génère une trajectoire sans collision. Ce découplage permet au drone de continuer à naviguer vers son objectif même en cas de perte de contact visuel. Sur des expériences menées en simulation et en environnement réel, les auteurs rapportent un taux de réussite supérieur de plus de 20 points par rapport aux meilleures méthodes existantes, ainsi qu'une erreur de navigation réduite d'environ 50 % dans des environnements non structurés. L'enjeu pratique de ce travail est la latence et la stabilité des systèmes de navigation pilotés par IA générative. Utiliser un MLLM comme contrôleur bas niveau en continu produit typiquement des oscillations de trajectoire et une forte latence, deux défauts rédhibitoires pour un drone évoluant en environnement contraint. En confiant le raisonnement sémantique au MLLM uniquement pour l'ancrage initial de la cible, puis en s'appuyant sur un planificateur géométrique classique pour l'exécution, Fly0 réduit la charge de calcul et évite l'inférence continue, ce qui va dans le sens d'une meilleure applicabilité embarquée pour l'inspection, la logistique ou la surveillance par drone autonome. Ce travail s'inscrit dans une tendance plus large de la recherche en VLN et en robotique aérienne, où l'ancrage géométrique persistant (les auteurs parlent de « metric anchoring ») cherche à corriger les limites des architectures purement bout-en-bout fondées sur les VLA (Vision-Language-Action). Il reste à confirmer, au-delà des métriques annoncées dans l'article, la robustesse du système face à des instructions ambiguës ou des scènes encombrées non couvertes par les jeux de test utilisés, et à voir si cette approche modulaire est reprise par d'autres équipes ou intégrée dans des plateformes commerciales de drones autonomes.

RecherchePaper
1 source
SuperMap : un système SLAM spatio-temporel pour la navigation vision-langage
4arXiv cs.RO 

SuperMap : un système SLAM spatio-temporel pour la navigation vision-langage

La recherche présentée sous la référence arXiv:2608.22896v1 introduit SuperMap, un système de cartographie spatio-temporelle en quatre dimensions destiné à la navigation robotique guidée par le langage. Le système combine un module SLAM géométrique à haute fréquence avec une perception asynchrone en vocabulaire ouvert, c'est-à-dire capable de reconnaître des objets sans liste de catégories prédéfinie, grâce aux modèles de fondation actuels. Sa contribution centrale est un moteur de cartographie piloté par la cohérence, qui associe et réactive les instances d'objets en 3D tout en mettant à jour une confiance combinée sur l'existence et l'étiquette de chaque élément, afin de préserver des identités stables et d'élaguer les contenus obsolètes lors d'occlusions ou de changements de scène. Le résultat est un graphe de scène 4D interrogeable, conçu pour s'interfacer avec des modèles vision-langage via des requêtes compositionnelles sur la sémantique des objets et leurs relations. Les auteurs valident l'approche sur des benchmarks et sur des robots réels, dans des scènes dynamiques incluant apparition, disparition et déplacement d'objets, avec des études d'ablation et une analyse des temps d'exécution. Le système est publié en open source, avec un site dédié à l'adresse superodometry.com/supermap. L'enjeu dépasse la simple démonstration technique. Les modèles de fondation offrent une reconnaissance dite « zero-shot » puissante, mais leurs prédictions restent intermittentes et dépendantes du point de vue caméra : intégrées naïvement dans un pipeline de cartographie, elles provoquent une dérive d'identité, où le même objet revu sous un angle différent est traité comme un nouvel élément, et une sémantique qui ne se met plus à jour. Pour les intégrateurs de robots mobiles destinés aux environnements humains, entrepôts, bureaux ou domiciles, ce problème conditionne directement la fiabilité d'une navigation langage-guidée sur la durée, au-delà d'une simple démo ponctuelle. SuperMap déplace ainsi le curseur du secteur : le défi n'est plus seulement de faire fonctionner un modèle vision-langage-action, mais de maintenir une représentation du monde cohérente dans le temps. Le nom du projet, associé au site superodometry.com, suggère une filiation avec des travaux antérieurs en odométrie et SLAM géométrique, ici étendus à une couche sémantique persistante. L'article ne détaille pas de comparatif nommé avec des systèmes concurrents de graphes de scène ouverts, mais la publication complète en open source vise explicitement à fournir à la communauté robotique une base de référence déployable pour la cartographie spatio-temporelle en vocabulaire ouvert, plutôt qu'un simple résultat de recherche isolé.

RecherchePaper
1 source