Aller au contenu principal
LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme
RecherchearXiv cs.RO 

LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent LH-AVLN (Long-Horizon Audio-Visual-Language Navigation), un nouveau benchmark pour évaluer des agents de navigation autonome devant accomplir des missions longues combinant vision, langage et audio spatialisé. Contrairement aux benchmarks existants, généralement silencieux et centrés sur un objectif unique, LH-AVLN impose à l'agent une mission globale de deux à quatre objectifs, spécifiés soit par catégorie d'objet, soit par description en langage naturel, soit par image de référence. L'agent navigue dans des environnements intérieurs en 3D à l'aide d'observations RGB-D, de données de pose et de son binaural persistant, les missions pouvant être ordonnées ou non. Les chercheurs ont aussi développé PAG-Nav, un agent de référence sans entraînement (training-free) qui construit une carte sémantique temporelle uniforme et planifie ses déplacements de façon progressive, utilisant le son pour guider la recherche hors champ de vision tout en réservant la confirmation finale d'un objectif à une vérification visuelle et sémantique.

Ce travail met en lumière un écart important entre les capacités démontrées par les agents actuels et les exigences de missions longues et multimodales. Les tests montrent que les agents existants, qu'ils soient basés sur la vision-langage, la mémoire ou l'audio-visuel, échouent largement à compléter des missions LH-AVLN dans leur intégralité. Ce constat interroge la solidité réelle des approches de navigation incarnée dès qu'elles sortent du cadre mono-objectif habituel des benchmarks académiques, un signal utile pour les équipes de recherche en robotique mobile et en IA incarnée qui cherchent à évaluer la maturité réelle de leurs systèmes avant tout déploiement.

LH-AVLN s'inscrit dans une tendance de fond de la recherche en navigation incarnée, qui délaisse progressivement les tâches ponctuelles pour des scénarios de mission complexes et prolongés, plus proches des besoins réels en robotique de service ou d'inspection. En proposant simultanément des indices sonores persistants, des spécifications d'objectifs hétérogènes et des missions multi-étapes, ce benchmark comble un vide par rapport aux travaux antérieurs en navigation audio-visuelle, généralement focalisés sur un seul objectif. PAG-Nav, présenté comme référence diagnostique plutôt que solution définitive, laisse une marge de progression substantielle, ouvrant la voie à de futurs travaux combinant mieux perception multimodale et planification à long terme.

Dans nos dossiers

À lire aussi

RVN-Bench : un benchmark pour la navigation visuelle réactive
1arXiv cs.RO 

RVN-Bench : un benchmark pour la navigation visuelle réactive

Des chercheurs présentent RVN-Bench (Reactive Visual Navigation Benchmark), un nouveau protocole d'évaluation pour la navigation visuelle sécurisée des robots mobiles en intérieur. Construit sur le simulateur Habitat 2.0 et les scènes photoréalistes HM3D, RVN-Bench place un agent robotique dans des environnements intérieurs jamais vus auparavant, sans carte préalable, avec pour seule information des observations visuelles brutes. L'agent doit atteindre une série d'objectifs de position successifs tout en évitant les collisions, une contrainte que les benchmarks existants négligent généralement ou qu'ils appliquent à des scénarios extérieurs peu transposables aux espaces encombrés d'un intérieur. Le système fournit un environnement d'apprentissage par renforcement en ligne, un générateur de jeux de trajectoires en images, ainsi que des outils dédiés à la production de jeux de données "négatifs" capturant spécifiquement les événements de collision, permettant un entraînement hors ligne aussi bien qu'en ligne. Les auteurs ont validé leur approche par des tests physiques sur un robot terrestre Jackal UGV. Ce travail comble un vide méthodologique réel pour l'industrie robotique : la plupart des benchmarks de navigation visuelle mesurent la capacité à atteindre un objectif sans pénaliser les collisions, ce qui masque un défaut critique pour tout déploiement en usine, entrepôt ou établissement de santé où un robot mobile évolue au milieu d'humains et d'obstacles mobiles. En intégrant la sécurité de trajectoire comme métrique de premier plan, RVN-Bench donne aux équipes de recherche et aux intégrateurs un outil standardisé pour comparer des politiques de navigation sur un critère qui compte réellement en production, plutôt que sur la seule réussite de la tâche. Les résultats indiquant une généralisation à des environnements simulés inédits et un transfert sim-to-real prometteur sur Jackal restent toutefois préliminaires : les auteurs eux-mêmes qualifient ces expériences physiques d'initiales, et la portée du transfert vers des robots aux dynamiques différentes reste à démontrer. RVN-Bench s'inscrit dans une lignée de benchmarks de navigation basés sur Habitat, déjà largement utilisés par la communauté de recherche en robotique et en apprentissage par renforcement visuel. Le code, les jeux de données et les outils associés sont publiés en accès libre, une pratique désormais standard pour ce type de contribution académique visant l'adoption par d'autres laboratoires. Aucun acteur français ou européen n'est mentionné dans ces travaux, qui restent pour l'instant au stade de la recherche et n'ont pas de calendrier de déploiement commercial annoncé.

RecherchePaper
1 source
Au-delà de l'isolement : un benchmark unifié pour la navigation polyvalente
2arXiv cs.RO 

Au-delà de l'isolement : un benchmark unifié pour la navigation polyvalente

Une équipe de chercheurs vient de publier OmniNavBench (arXiv:2505.09441), un nouveau benchmark conçu pour évaluer la navigation des agents incarnés dans des conditions proches du réel. Contrairement aux protocoles existants qui testent une compétence à la fois sur un seul type de robot, OmniNavBench impose des instructions composites enchaînant six catégories de sous-tâches au sein d'un même épisode : navigation vers un point cible (PointNav), navigation guidée par le langage (VLN), recherche d'objets (ObjectNav), navigation sociale (SocialNav), suivi de personne (Human Following) et question-réponse incarnée (EQA). La plateforme de simulation propose 170 environnements combinant assets synthétiques et scans de lieux réels, et couvre trois morphologies robotiques : humanoïdes, quadrupèdes et robots à roues. Le dataset comprend 1 779 trajectoires expertes collectées par télé-opération humaine, capturant des nuances comportementales comme les regards exploratoires et les évitements anticipatoires, au lieu des classiques plus courts chemins algorithmiques. L'intérêt de ce travail est de révéler une faille systémique dans l'évaluation actuelle des agents navigants. Les méthodes publiées, même celles se réclamant d'une conception unifiée, peinent dès lors qu'on leur demande d'enchaîner des comportements hétérogènes dans un seul épisode continu. Ce résultat contredit implicitement les affirmations de généralité de plusieurs architectures récentes et met en évidence un écart réel entre les performances en benchmark isolé et les exigences d'un déploiement terrain. Pour un intégrateur ou un décideur industriel, cela signifie que les métriques publiées sur des benchmarks mono-tâche ne sont pas transposables à des scénarios opérationnels où un robot doit simultanément localiser un objet, éviter un humain et répondre à une consigne en langage naturel. OmniNavBench s'inscrit dans une dynamique plus large d'unification des évaluations en robotique incarnée, un domaine où les benchmarks fragmentés ont longtemps permis aux équipes de revendiquer des SOTA partiels sans comparabilité réelle. Les benchmarks dominants comme R2R (Vision-and-Language Navigation) ou HM3D (Habitat) restent mono-morphologie et mono-tâche. La plateforme est disponible en open access avec dataset, code et leaderboard, ce qui facilitera l'adoption par la communauté. Les suites logiques incluent l'intégration de modèles VLA récents comme pi0 ou GR00T N2 dans le leaderboard, et potentiellement des évaluations en simulation-to-real pour tester si les scores obtenus se transfèrent sur hardware réel.

RecherchePaper
1 source
SuperMap : un système SLAM spatio-temporel pour la navigation vision-langage
3arXiv cs.RO 

SuperMap : un système SLAM spatio-temporel pour la navigation vision-langage

La recherche présentée sous la référence arXiv:2608.22896v1 introduit SuperMap, un système de cartographie spatio-temporelle en quatre dimensions destiné à la navigation robotique guidée par le langage. Le système combine un module SLAM géométrique à haute fréquence avec une perception asynchrone en vocabulaire ouvert, c'est-à-dire capable de reconnaître des objets sans liste de catégories prédéfinie, grâce aux modèles de fondation actuels. Sa contribution centrale est un moteur de cartographie piloté par la cohérence, qui associe et réactive les instances d'objets en 3D tout en mettant à jour une confiance combinée sur l'existence et l'étiquette de chaque élément, afin de préserver des identités stables et d'élaguer les contenus obsolètes lors d'occlusions ou de changements de scène. Le résultat est un graphe de scène 4D interrogeable, conçu pour s'interfacer avec des modèles vision-langage via des requêtes compositionnelles sur la sémantique des objets et leurs relations. Les auteurs valident l'approche sur des benchmarks et sur des robots réels, dans des scènes dynamiques incluant apparition, disparition et déplacement d'objets, avec des études d'ablation et une analyse des temps d'exécution. Le système est publié en open source, avec un site dédié à l'adresse superodometry.com/supermap. L'enjeu dépasse la simple démonstration technique. Les modèles de fondation offrent une reconnaissance dite « zero-shot » puissante, mais leurs prédictions restent intermittentes et dépendantes du point de vue caméra : intégrées naïvement dans un pipeline de cartographie, elles provoquent une dérive d'identité, où le même objet revu sous un angle différent est traité comme un nouvel élément, et une sémantique qui ne se met plus à jour. Pour les intégrateurs de robots mobiles destinés aux environnements humains, entrepôts, bureaux ou domiciles, ce problème conditionne directement la fiabilité d'une navigation langage-guidée sur la durée, au-delà d'une simple démo ponctuelle. SuperMap déplace ainsi le curseur du secteur : le défi n'est plus seulement de faire fonctionner un modèle vision-langage-action, mais de maintenir une représentation du monde cohérente dans le temps. Le nom du projet, associé au site superodometry.com, suggère une filiation avec des travaux antérieurs en odométrie et SLAM géométrique, ici étendus à une couche sémantique persistante. L'article ne détaille pas de comparatif nommé avec des systèmes concurrents de graphes de scène ouverts, mais la publication complète en open source vise explicitement à fournir à la communauté robotique une base de référence déployable pour la cartographie spatio-temporelle en vocabulaire ouvert, plutôt qu'un simple résultat de recherche isolé.

RecherchePaper
1 source
OVMAN : une tâche et un benchmark pour la navigation à vocabulaire ouvert sensible au mouvement
4arXiv cs.RO 

OVMAN : une tâche et un benchmark pour la navigation à vocabulaire ouvert sensible au mouvement

OVMAN est un nouveau benchmark de navigation robotique (arXiv:2609.06424v2) où un agent doit retrouver, lors d'une deuxième visite, un objet déplacé ou disparu depuis son premier passage, par exemple "va vers la chaise qui a été déplacée" ou "va là où se trouvait le vase". Le jeu de données compte 219 épisodes à deux visites, chacun certifié résoluble par un agent oracle en trois passages, répartis sur six relations de changement dont deux ciblent un emplacement désormais vide. Un navigateur d'objets en zero-shot n'atteint sa cible que dans 12,3% des épisodes, avec des scores quasi nuls sur ces emplacements vidés (0,026 et 0,050). Une carte open-vocabulary auto-actualisée fait grimper le taux de réussite global de 0,396 à 0,479 sans progresser sur ces cas précis, tandis qu'un agent de référence simple plafonne à 45,2% contre 99,5% pour un oracle incarné. Ces résultats montrent qu'actualiser une carte sémantique de l'environnement ne suffit pas à résoudre la navigation dans un monde qui change entre deux visites, une nuance pour les approches de cartographie continue mises en avant dans la recherche récente. La décomposition d'erreur des auteurs situe le vrai obstacle ailleurs que dans la perception : ni la reconnaissance du nom de l'objet ni le choix final de la réponse ne posent problème, c'est le maintien de l'identité d'une même instance d'un objet d'une visite à l'autre qui échoue. Pour un intégrateur en logistique ou à domicile, où les objets bougent entre deux passages d'un robot, cela déplace l'effort d'ingénierie vers la mémoire et la correspondance d'instances plutôt que vers la seule perception ou le mapping temps réel. OVMAN s'ajoute aux benchmarks de navigation vision-langage qui supposaient jusqu'ici une scène figée entre la formulation d'une instruction et son exécution, une hypothèse rarement vraie hors laboratoire. Les auteurs publient les 219 épisodes et leur protocole de certification par oracle pour que d'autres équipes puissent comparer leurs systèmes sur cette tâche précise. Aucun acteur commercial ni déploiement produit n'est associé à ce travail, qui reste une contribution académique destinée à orienter les futurs systèmes de navigation embarquée vers la gestion de la mémoire d'instance entre visites.

RecherchePaper
1 source