Aller au contenu principal
AirGroundVLN : un benchmark à grande échelle pour la navigation vision-langage collaborative air-sol orientée vers un objectif
RecherchearXiv cs.RO 

AirGroundVLN : un benchmark à grande échelle pour la navigation vision-langage collaborative air-sol orientée vers un objectif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv AirGroundVLN, un benchmark dédié à la navigation guidée par vision et langage (VLN) pour des équipes mixtes drone et robot terrestre. Il regroupe 10 281 épisodes de navigation et 955 instances de cibles réparties sur 19 environnements simulés sous Unreal Engine. Il propose des découpages « vus » et « non vus » pour mesurer la généralisation, ainsi qu'un protocole de visibilité aérienne qui encadre ce que le drone perçoit pendant l'évaluation. Les auteurs livrent aussi AG-CoNAV, un cadre de référence entraînable. Il repose sur deux modules. Le premier, SACM (Spatiotemporally Anchored Collaborative Memory), conserve et retrouve un contexte historique cohérent dans l'espace à partir des observations aériennes et terrestres. Le second, AGRLP (Aerial-Guided Regional-to-Local Planning), combine un guidage régional fourni par la vue aérienne et une navigation fine au sol. Les auteurs annoncent des expériences « extensives » validant AG-CoNAV, mais le résumé ne donne aucun score chiffré.

La tâche est de type « goal-oriented » : l'agent doit trouver et atteindre une cible décrite en langage naturel, sans itinéraire prescrit. C'est plus proche d'une mission réelle que le VLN classique, où l'on suit des instructions pas à pas. Le benchmark cible deux difficultés précises. Les vues aérienne et terrestre diffèrent fortement, et des observations utiles disparaissent au fil du déplacement, ce qui complique le maintien d'un contexte spatial cohérent entre plateformes et dans le temps. Par ailleurs, l'observabilité est asymétrique : le sol voit avec précision mais sur un champ limité, tandis que le drone couvre une large zone avec peu de détail local. Ce couple correspond à des usages concrets, comme l'inspection de sites industriels, la logistique extérieure, la recherche et le secours, ou la surveillance de grands entrepôts. Cependant, tout le travail reste en simulation. Aucun transfert sim-to-real n'est démontré, et l'écart entre environnements Unreal et terrain réel, avec ses occlusions, son vent et sa perception bruitée, reste entier. Le benchmark fournit surtout un terrain commun pour comparer des méthodes multi-robots hétérogènes, qui manquait jusqu'ici.

Ce travail s'inscrit dans la montée des modèles vision-langage-action (VLA) et de la navigation incarnée, qui se sont longtemps concentrés sur un seul agent, au sol ou en vol. Les benchmarks VLN aériens et terrestres existent séparément, mais la collaboration air-sol y était peu étudiée à grande échelle. Aucun acteur industriel ni produit n'est cité, et l'article ne mentionne aucun pilote ni calendrier de déploiement : il s'agit d'une contribution purement académique, au stade de préimpression (v1) et sans évaluation par les pairs. La suite logique consiste à voir si d'autres équipes adoptent le benchmark, si des modèles de fondation généralistes dépassent AG-CoNAV, et si des validations sur matériel réel apparaissent. Les intégrateurs qui suivent les flottes mixtes drones et robots mobiles y trouveront surtout un indicateur de maturité de la recherche, pas encore une technologie déployable.

À lire aussi

Navigation air-sol collaborative vision-langage pour la navigation via cartes aériennes partagées
1arXiv cs.RO 

Navigation air-sol collaborative vision-langage pour la navigation via cartes aériennes partagées

Des chercheurs ont publié sur arXiv (2609.03483) un système baptisé AGC-VLN, pour "Air-Ground Collaborative Vision-and-Language Navigation", qui fait collaborer un drone (UAV) offrant une vue aérienne globale et un véhicule terrestre autonome (UGV) doté d'une caméra en vue subjective. Le drone superpose sur sa vue plongeante la position rapportée de l'UGV et la cible identifiée par un modèle vision-langage (VLM), sous forme de repères "CAR" et "GOAL" avec distances, pour construire une carte partagée en vue aérienne. L'UGV s'en sert pour planifier un trajet le long des routes avec un VLM figé, non réentraîné, pendant que le drone exécute en parallèle 3D-SPF, une variante de la méthode de localisation SPF, pour repérer et rejoindre la cible depuis les airs. Sur 100 épisodes en boucle fermée dans la scène Town10HD du simulateur CARLA-Air, le taux de réussite conjoint atteint 77,0%, contre 50,0% pour le drone seul, soit un gain de collaboration de 27,0 points, et dépasse de 24,0 points la meilleure référence mono-agent publiée, Travel UAV (53,0%). Ce travail comble un angle mort documenté: une évaluation récente sur CARLA-Air portant sur cinq modèles VLA de pointe n'avait trouvé aucune coopération stable entre drone et robot terrestre, la communication sémantique naïve ou le couplage bidirectionnel dégradant même les performances. AGC-VLN propose une architecture sans réentraînement, qui sépare le raisonnement sémantique confié au VLM de l'exécution géométrique déterministe, ouvrant une interface de collaboration exploitable sans données supplémentaires. Pour les intégrateurs qui déploient des flottes hétérogènes drones et robots mobiles, la preuve que le gain vient de la complémentarité des points de vue plutôt que d'un modèle plus puissant plaide pour des architectures multi-agents modulaires plutôt que des VLA monolithiques appliqués robot par robot. Le papier s'inscrit dans la lignée des méthodes de navigation vision-langage sans entraînement, jusqu'ici cantonnées au mono-agent, et se compare à Travel UAV ainsi qu'à SPF, dont 3D-SPF est une extension. Les auteurs revendiquent la première base de référence "training-free" pour la navigation collaborative air-sol, une affirmation à prendre comme un positionnement plutôt qu'un fait vérifié indépendamment, le domaine restant, de leur propre aveu, largement inexploré. Les résultats reposent uniquement sur simulation, sans essai en conditions réelles ni chiffres de déploiement industriel; le code est publié sur GitHub (ZSN2024/AGC-VLN), laissant ouverte la question du transfert simulation-vers-réel pour des flottes physiques.

RechercheActu
1 source
RVN-Bench : un benchmark pour la navigation visuelle réactive
2arXiv cs.RO 

RVN-Bench : un benchmark pour la navigation visuelle réactive

Des chercheurs présentent RVN-Bench (Reactive Visual Navigation Benchmark), un nouveau protocole d'évaluation pour la navigation visuelle sécurisée des robots mobiles en intérieur. Construit sur le simulateur Habitat 2.0 et les scènes photoréalistes HM3D, RVN-Bench place un agent robotique dans des environnements intérieurs jamais vus auparavant, sans carte préalable, avec pour seule information des observations visuelles brutes. L'agent doit atteindre une série d'objectifs de position successifs tout en évitant les collisions, une contrainte que les benchmarks existants négligent généralement ou qu'ils appliquent à des scénarios extérieurs peu transposables aux espaces encombrés d'un intérieur. Le système fournit un environnement d'apprentissage par renforcement en ligne, un générateur de jeux de trajectoires en images, ainsi que des outils dédiés à la production de jeux de données "négatifs" capturant spécifiquement les événements de collision, permettant un entraînement hors ligne aussi bien qu'en ligne. Les auteurs ont validé leur approche par des tests physiques sur un robot terrestre Jackal UGV. Ce travail comble un vide méthodologique réel pour l'industrie robotique : la plupart des benchmarks de navigation visuelle mesurent la capacité à atteindre un objectif sans pénaliser les collisions, ce qui masque un défaut critique pour tout déploiement en usine, entrepôt ou établissement de santé où un robot mobile évolue au milieu d'humains et d'obstacles mobiles. En intégrant la sécurité de trajectoire comme métrique de premier plan, RVN-Bench donne aux équipes de recherche et aux intégrateurs un outil standardisé pour comparer des politiques de navigation sur un critère qui compte réellement en production, plutôt que sur la seule réussite de la tâche. Les résultats indiquant une généralisation à des environnements simulés inédits et un transfert sim-to-real prometteur sur Jackal restent toutefois préliminaires : les auteurs eux-mêmes qualifient ces expériences physiques d'initiales, et la portée du transfert vers des robots aux dynamiques différentes reste à démontrer. RVN-Bench s'inscrit dans une lignée de benchmarks de navigation basés sur Habitat, déjà largement utilisés par la communauté de recherche en robotique et en apprentissage par renforcement visuel. Le code, les jeux de données et les outils associés sont publiés en accès libre, une pratique désormais standard pour ce type de contribution académique visant l'adoption par d'autres laboratoires. Aucun acteur français ou européen n'est mentionné dans ces travaux, qui restent pour l'instant au stade de la recherche et n'ont pas de calendrier de déploiement commercial annoncé.

RecherchePaper
1 source
Diffusion de carte d'étiquettes plug-and-play pour la navigation universelle orientée objectif
3arXiv cs.RO 

Diffusion de carte d'étiquettes plug-and-play pour la navigation universelle orientée objectif

Une équipe de chercheurs a publié le 8 mai 2026 sur arXiv (référence 2605.05960) une méthode baptisée PLMD (Plug-and-Play Label Map Diffusion) pour la navigation robotique orientée objectif, dite GON (Goal-Oriented Navigation). Le défi central de cette classe de problèmes est le suivant : un robot doit localiser un objet cible dans un environnement qu'il n'a pas encore exploré, en construisant simultanément une carte en vue du dessus (BEV, Bird's-Eye-View). PLMD mobilise les modèles de diffusion probabiliste par débruitage (DDPM), popularisés en génération d'images, pour compléter ces cartes partielles à la volée : le système génère des étiquettes d'obstacles et des labels sémantiques pour les zones non encore visitées, permettant au robot de raisonner sur des régions qu'il n'a pas encore traversées. Les auteurs annoncent des performances état de l'art sur trois tâches GON distinctes, sans détailler les benchmarks ni les marges dans le seul abstract disponible. L'intérêt de l'approche tient à deux corrections apportées aux limites des méthodes existantes. Les cartes sémantiques auto-centrées échouent fréquemment en exploration partielle, précisément le cas réel, car elles supposent une connaissance complète de l'environnement. PLMD contourne ce verrou en extrapolant les zones inconnues de façon structurée, en exploitant la cohérence géométrique entre obstacles connus et inconnus pour guider le débruitage sémantique. Parallèlement, l'incohérence d'association sémantique, un même objet catégorisé différemment selon le point de vue du robot, est atténuée en intégrant des priors d'obstacles dans ce processus. Le qualificatif "plug-and-play" n'est pas qu'un argument marketing : la méthode est architecturée pour se greffer sur des pipelines de navigation sémantique existants sans réentraînement complet des modules sous-jacents, ce qui facilite son adoption dans des systèmes déjà déployés. La navigation orientée objectif dans des environnements non cartographiés est un problème de référence de l'embodied AI, évalué classiquement sur des benchmarks comme HM3D, MP3D ou RoboTHOR. Les approches concurrentes vont de l'exploration par frontières (frontier-based) aux modèles de langage visuels (VLM) comme EmbCLIP ou ESC, qui contournent la carte explicite en s'appuyant sur des embeddings pré-entraînés. PLMD se positionne dans le segment "map-based" en cherchant à corriger ses faiblesses structurelles plutôt qu'à les éviter. L'application des modèles de diffusion à la complétion de cartes topologiques est une direction de recherche émergente, distincte de leur usage en synthèse d'images ou de trajectoires. À ce stade, la contribution reste une validation en simulation, une évaluation sur robots physiques constituerait la prochaine étape décisive.

RecherchePaper
1 source
NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents
4arXiv cs.RO 

NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents

NavHarness, un framework publié sur arXiv (v1), propose d'aborder la navigation vision-langage (VLN) par une architecture à quatre agents spécialisés plutôt que par un seul agent multimodal généraliste. Un Goal Agent fixe des sous-objectifs adaptatifs à partir de l'instruction, de l'observation courante et de l'historique d'exécution. Un Visuomotor Agent exécute les actions de navigation pour atteindre chaque objectif. Un Verify Agent juge ensuite si l'objectif est atteint, grâce à une question de vérification propre à cet objectif. Un Memory Agent compresse enfin l'historique multimodal correspondant, en conservant l'information utile à la suite du trajet. Les auteurs évaluent le système sur les benchmarks simulés R2R-CE et RxR-CE, comparent des variantes sur trois modèles de base et analysent l'évolution du contexte pendant l'exécution. En conditions réelles, NavHarness atteint 83,3 % de succès et 1,51 m d'erreur de navigation sur huit parcours jugés difficiles, chacun parcouru trois fois, soit 24 essais au total. L'intérêt tient à deux problèmes concrets des agents embarqués pilotés par des modèles multimodaux. Le premier est la dérive sur les tâches longues : choisir une action locale plausible à chaque pas ne garantit pas de rester sur l'itinéraire voulu. La vérification explicite de chaque sous-objectif vise à corriger cette dérive en cours de route. Le second est le coût d'inférence : si l'historique image-texte est réinjecté tel quel à chaque décision, l'entrée grossit sans cesse. Le découpage de l'historique en segments compressés à chaque objectif validé est une réponse d'ingénierie pragmatique, qui concerne directement les intégrateurs soucieux de la latence et du coût de calcul embarqué. Les résultats appellent toutefois de la prudence : l'échantillon réel est restreint (huit parcours, trois passes), la nature des environnements n'est pas détaillée dans le résumé et l'article ne chiffre pas, dans cet extrait, le gain de calcul obtenu. Ce travail s'inscrit dans la tendance qui consiste à réutiliser des modèles multimodaux généralistes comme base de la navigation, plutôt que d'entraîner des politiques dédiées. R2R-CE et RxR-CE, versions en environnement continu des benchmarks Room-to-Room et Room-across-Room, sont des références habituelles de ce champ. Le texte ne fournit ni comparaison chiffrée avec des méthodes concurrentes, ni robot, ni calendrier de déploiement : il s'agit d'une publication de recherche, pas d'un produit. La suite logique serait de mesurer le système sur davantage d'environnements réels et de quantifier précisément l'économie de contexte apportée par la compression.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source