Aller au contenu principal
VoLN : navigation à long terme uniquement par vision (paradigme, référentiel et méthode)
RecherchearXiv cs.RO 

VoLN : navigation à long terme uniquement par vision (paradigme, référentiel et méthode)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VoLN (Vision-Only Long-Horizon Navigation), un nouveau paradigme de navigation pour agents embarqués qui se passe totalement d'instructions en langage naturel détaillées. Publié sur arXiv le 24 juillet 2026, ce travail part d'un constat : dans la navigation vision-langage classique (VLN), les instructions de type "tournez à droite après 50 mètres" encodent des informations spatiales (orientation, distance, disposition des lieux) que l'agent ne peut pas réellement percevoir depuis ses seuls capteurs, surtout dans des environnements ouverts sans GPS. VoLN retire ces indices explicites : seule une image de destination est fournie, et l'agent doit repérer, interpréter et suivre des repères visuels locaux pour progresser. L'équipe a instancié ce paradigme pour le vol de drones avec VoLN-UAV, un benchmark de 7 210 épisodes combinant vols longue distance orientés objectif, mouvements 3D continus, changements de point de vue importants et sélection de balises dépendante du contexte. Un modèle de référence, VoLN-MLLM, aligne des caractéristiques visuelles auto-supervisées sur un espace sémantique structuré et prédit des segments de trajectoire courts à partir de l'historique d'observation, des vues cibles, de tokens visuo-sémantiques récupérés et de la proprioception.

Les résultats obtenus sur le split Test-Unseen (cinq environnements) sont particulièrement bas : 7,4% de réussite sur les épisodes faciles, 4,5% sur les normaux et seulement 1,8% sur les difficiles. Ces chiffres, très inférieurs aux performances habituellement rapportées en VLN classique, illustrent l'écart entre la navigation guidée par instructions explicites et une navigation purement visuelle où l'agent doit reconstruire lui-même la structure de l'itinéraire. Pour les équipes travaillant sur l'autonomie des drones et des robots en environnements GPS-denied, ce résultat sert d'avertissement : les scores impressionnants obtenus sur les benchmarks VLN traditionnels reflètent en partie la richesse des instructions fournies, pas uniquement la capacité de perception et de décision de l'agent.

VoLN s'inscrit dans la lignée des travaux sur la navigation vision-langage, en proposant une lecture complémentaire plutôt qu'un remplacement des benchmarks existants. En isolant la composante purement visuelle du problème, les auteurs cherchent à mesurer séparément l'intégration d'indices sur un horizon long, l'appariement d'images entre différents points de vue et la stabilité en boucle fermée, trois faiblesses identifiées comme majeures par leurs expériences. Le code et les détails du benchmark sont disponibles sur la page du projet, ouvrant la voie à des comparaisons futures pour d'autres plateformes robotiques que les drones.

Dans nos dossiers

À lire aussi

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
1arXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs. Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé. La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

RecherchePaper
1 source
LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme
2arXiv cs.RO 

LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme

Des chercheurs présentent LH-AVLN (Long-Horizon Audio-Visual-Language Navigation), un nouveau benchmark pour évaluer des agents de navigation autonome devant accomplir des missions longues combinant vision, langage et audio spatialisé. Contrairement aux benchmarks existants, généralement silencieux et centrés sur un objectif unique, LH-AVLN impose à l'agent une mission globale de deux à quatre objectifs, spécifiés soit par catégorie d'objet, soit par description en langage naturel, soit par image de référence. L'agent navigue dans des environnements intérieurs en 3D à l'aide d'observations RGB-D, de données de pose et de son binaural persistant, les missions pouvant être ordonnées ou non. Les chercheurs ont aussi développé PAG-Nav, un agent de référence sans entraînement (training-free) qui construit une carte sémantique temporelle uniforme et planifie ses déplacements de façon progressive, utilisant le son pour guider la recherche hors champ de vision tout en réservant la confirmation finale d'un objectif à une vérification visuelle et sémantique. Ce travail met en lumière un écart important entre les capacités démontrées par les agents actuels et les exigences de missions longues et multimodales. Les tests montrent que les agents existants, qu'ils soient basés sur la vision-langage, la mémoire ou l'audio-visuel, échouent largement à compléter des missions LH-AVLN dans leur intégralité. Ce constat interroge la solidité réelle des approches de navigation incarnée dès qu'elles sortent du cadre mono-objectif habituel des benchmarks académiques, un signal utile pour les équipes de recherche en robotique mobile et en IA incarnée qui cherchent à évaluer la maturité réelle de leurs systèmes avant tout déploiement. LH-AVLN s'inscrit dans une tendance de fond de la recherche en navigation incarnée, qui délaisse progressivement les tâches ponctuelles pour des scénarios de mission complexes et prolongés, plus proches des besoins réels en robotique de service ou d'inspection. En proposant simultanément des indices sonores persistants, des spécifications d'objectifs hétérogènes et des missions multi-étapes, ce benchmark comble un vide par rapport aux travaux antérieurs en navigation audio-visuelle, généralement focalisés sur un seul objectif. PAG-Nav, présenté comme référence diagnostique plutôt que solution définitive, laisse une marge de progression substantielle, ouvrant la voie à de futurs travaux combinant mieux perception multimodale et planification à long terme.

RecherchePaper
1 source
UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert
3arXiv cs.RO 

UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert

Un nouveau benchmark baptisé UAV-ON vise à évaluer la capacité de drones autonomes à localiser des objets dans de vastes environnements ouverts, sans dépendre d'instructions linguistiques détaillées. Publié sur arXiv (2508.00288v5), le jeu de données couvre 14 environnements haute fidélité construits sous Unreal Engine, mêlant zones urbaines, milieux naturels et espaces mixtes, avec des agencements spatiaux complexes. Il définit 1270 objets cibles annotés individuellement, chacun décrit par une instruction de niveau instance précisant la catégorie, l'emprise physique et des descripteurs visuels, permettant un raisonnement ancré dans la scène. Les chercheurs ont aussi implémenté plusieurs méthodes de référence, dont Aerial ObjectNav Agent (AOA), une politique modulaire combinant sémantique de l'instruction et observations égocentriques pour une exploration orientée objectif sur de longs horizons. Résultat: tous les modèles testés peinent à accomplir la tâche, ce qui souligne la difficulté cumulée de la navigation aérienne et de l'ancrage sémantique des objectifs. Ce benchmark marque une rupture avec le paradigme dominant de la navigation vision-langage (VLN), qui repose sur des séquences d'instructions pas à pas et limite de fait l'autonomie et le passage à l'échelle des agents. En proposant une tâche d'Object Goal Navigation où l'agent ne reçoit qu'un objectif sémantique de haut niveau, UAV-ON teste une compétence plus proche des besoins réels d'inspection, de surveillance ou de cartographie par drone. L'échec généralisé des baselines confirme que le passage d'instructions détaillées à des objectifs sémantiques abstraits reste un verrou majeur, loin d'être résolu malgré les progrès des modèles vision-langage-action sur d'autres plateformes robotiques. La navigation aérienne embarquée demeure sous-explorée comparée à la navigation terrestre, où les benchmarks VLN se sont multipliés ces dernières années. UAV-ON s'inscrit dans cette lignée en l'adaptant aux contraintes spécifiques du vol: grande échelle, environnements non structurés, absence de repères au sol. Les auteurs positionnent ce travail comme une fondation pour de futures recherches sur l'autonomie UAV pilotée par des descriptions sémantiques, ouvrant la voie à des méthodes capables de généraliser au-delà des scénarios scriptés actuels.

RecherchePaper
1 source
LookStep : navigation vision-langage efficace grâce à l'anticipation linguistique et une mémoire événementielle
4arXiv cs.RO 

LookStep : navigation vision-langage efficace grâce à l'anticipation linguistique et une mémoire événementielle

Des chercheurs ont publié LookStep, un framework de navigation vision-langage (VLN) qui vise à réduire les besoins en calcul et en données d'entraînement des agents suivant des instructions en langage naturel dans des environnements inconnus. Décrit dans un article déposé sur arXiv (identifiant 2609.02350v2, republication croisée), le code et le modèle sont disponibles en open source sur GitHub, sous le compte kunyang-YU. Le système combine deux mécanismes : une modélisation de futurs états centrée sur le langage, qui attribue à chaque action candidate une étiquette textuelle décrivant la progression de la navigation et l'état futur attendu, et une mémoire glissante événementielle bornée, qui décide de façon autonome quelles observations conserver en leur assignant un rôle sémantique. Sur le benchmark de référence R2R-CE Val-Unseen, LookStep atteint un taux de réussite de 49,7 %, supérieur aux méthodes existantes entraînées dans les mêmes conditions, avec une meilleure efficacité mémoire et moins de données utilisées. Ce résultat cible un point de friction connu de la navigation robotique par instructions : la plupart des méthodes récentes, portées par les grands modèles multimodaux (MLLM), reposent sur une prédiction action par action supervisée uniquement sur l'action experte, ce qui exige d'énormes volumes de données annotées. Elles s'appuient aussi sur des cartes cognitives, un historique complet d'images accumulées ou des outils 3D externes pour maintenir un état du monde, au prix d'une charge mémoire et calculatoire élevée. En montrant qu'un agent peut égaler, voire dépasser, ces méthodes avec une mémoire bornée et moins de données d'entraînement, LookStep suggère que l'efficacité ressource n'est pas nécessairement sacrifiée à la performance, un enjeu direct pour tout intégrateur visant un déploiement embarqué sur robot mobile ou drone plutôt qu'un calcul déporté vers le cloud. Le gain reste toutefois mesuré sur un seul benchmark simulé, sans validation rapportée sur robot physique en conditions réelles. L'approche s'inscrit dans la lignée des travaux récents exploitant les MLLM pour la navigation embarquée, un domaine où le paradigme dominant reste la prédiction du prochain pas d'action à partir des instructions et des observations visuelles. L'abstract ne mentionne aucun partenariat industriel, ni acteur commercial concurrent, ni calendrier de déploiement : il s'agit à ce stade d'un travail de recherche académique validé sur le benchmark VLN-CE, et non d'un produit commercialisé ou d'un pilote annoncé. La publication du code et du modèle en open source doit permettre à la communauté de reproduire les résultats et de comparer LookStep aux approches concurrentes de navigation vision-langage sur les mêmes jeux de données.

RecherchePaper
1 source