Aller au contenu principal
NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents
RecherchearXiv cs.RO 

NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

NavHarness, un framework publié sur arXiv (v1), propose d'aborder la navigation vision-langage (VLN) par une architecture à quatre agents spécialisés plutôt que par un seul agent multimodal généraliste. Un Goal Agent fixe des sous-objectifs adaptatifs à partir de l'instruction, de l'observation courante et de l'historique d'exécution. Un Visuomotor Agent exécute les actions de navigation pour atteindre chaque objectif. Un Verify Agent juge ensuite si l'objectif est atteint, grâce à une question de vérification propre à cet objectif. Un Memory Agent compresse enfin l'historique multimodal correspondant, en conservant l'information utile à la suite du trajet. Les auteurs évaluent le système sur les benchmarks simulés R2R-CE et RxR-CE, comparent des variantes sur trois modèles de base et analysent l'évolution du contexte pendant l'exécution. En conditions réelles, NavHarness atteint 83,3 % de succès et 1,51 m d'erreur de navigation sur huit parcours jugés difficiles, chacun parcouru trois fois, soit 24 essais au total.

L'intérêt tient à deux problèmes concrets des agents embarqués pilotés par des modèles multimodaux. Le premier est la dérive sur les tâches longues : choisir une action locale plausible à chaque pas ne garantit pas de rester sur l'itinéraire voulu. La vérification explicite de chaque sous-objectif vise à corriger cette dérive en cours de route. Le second est le coût d'inférence : si l'historique image-texte est réinjecté tel quel à chaque décision, l'entrée grossit sans cesse. Le découpage de l'historique en segments compressés à chaque objectif validé est une réponse d'ingénierie pragmatique, qui concerne directement les intégrateurs soucieux de la latence et du coût de calcul embarqué. Les résultats appellent toutefois de la prudence : l'échantillon réel est restreint (huit parcours, trois passes), la nature des environnements n'est pas détaillée dans le résumé et l'article ne chiffre pas, dans cet extrait, le gain de calcul obtenu.

Ce travail s'inscrit dans la tendance qui consiste à réutiliser des modèles multimodaux généralistes comme base de la navigation, plutôt que d'entraîner des politiques dédiées. R2R-CE et RxR-CE, versions en environnement continu des benchmarks Room-to-Room et Room-across-Room, sont des références habituelles de ce champ. Le texte ne fournit ni comparaison chiffrée avec des méthodes concurrentes, ni robot, ni calendrier de déploiement : il s'agit d'une publication de recherche, pas d'un produit. La suite logique serait de mesurer le système sur davantage d'environnements réels et de quantifier précisément l'économie de contexte apportée par la compression.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

ASENA : des agents auto-évolutifs pour la navigation de l'IA incarnée
1arXiv cs.RO 

ASENA : des agents auto-évolutifs pour la navigation de l'IA incarnée

Des chercheurs publient ASENA, un système d'agent incarné qui relie des agents de codage généralistes aux capteurs, au calcul, à l'exécution supervisée et à une mémoire persistante d'un robot. L'agent écrit et exécute des programmes, relit les résultats enregistrés, corrige ses échecs et réutilise des notes et des compétences exécutables, le tout sans modifier les poids du modèle. Le système s'accompagne d'ASENA-VLN, une politique de navigation monoculaire de 4 milliards de paramètres, proposée comme outil optionnel. Elle prédit des trajectoires dans le repère du corps, pour des itinéraires longs comme pour des comportements à court horizon, grâce à un décodeur vision-langage unique. Celui-ci est entraîné sur des instructions de parcours, des questions-réponses visuelles et un nouveau jeu de tâches de navigation « atomiques » dérivées de la géométrie. Seule, la politique atteint 68,7 % de succès sur R2R et 70,2 % sur RxR, ce que les auteurs présentent comme l'état de l'art. Couplée à l'agent de codage, elle ajoute 11 points de succès sur les deux benchmarks agentiques tout en réduisant le temps d'exécution. Dix passes sur des sous-ensembles récurrents de 100 tâches, avec retour du simulateur, font passer le succès de 72 % à 98 % sur R2R et de 65 % à 89 % sur RxR. En question-réponse incarnée, ASENA annonce aussi la meilleure précision, avec moins d'étapes d'interaction. Des démonstrations réelles sur un Unitree G1 combinent recherche, inspection visuelle, raisonnement spatial et gestes synthétisés, sans carte préalable. L'intérêt tient moins au score de navigation qu'à l'architecture. Ici, l'amélioration ne passe pas par un réentraînement : elle vient de la mémoire de l'agent (notes, scripts, compétences), ce qui rapproche le robot d'un logiciel qu'on débogue que d'un modèle qu'on affine. Pour un intégrateur, cela ouvre la voie à une adaptation d'un site à l'autre sans cycle de collecte de données ni de fine-tuning. Il faut toutefois lire les gains avec prudence. Le passage de 72 % à 98 % est mesuré sur des sous-ensembles de 100 tâches rejouées dix fois avec retour du simulateur : cela ressemble davantage à une mémorisation de tâches récurrentes qu'à une généralisation à des environnements inédits. Les résultats chiffrés restent obtenus en simulation, et les démonstrations sur G1 sont qualitatives, sans taux de réussite, durée ni nombre d'essais publiés. L'écart entre démonstration et fiabilité en conditions réelles reste donc entier. Ce travail s'inscrit dans deux tendances qui convergent : les politiques vision-langage-action pour la navigation, évaluées sur R2R et RxR, et les agents de codage appliqués à la robotique, où le LLM génère du code plutôt que des commandes bas niveau. En faisant de la politique apprise un simple outil parmi d'autres, ASENA se positionne à l'opposé des approches de bout en bout comme Pi-0 ou GR00T, qui concentrent tout dans un seul modèle. Le G1 de Unitree, plateforme humanoïde à bas coût largement répandue en recherche, sert de support. Il s'agit d'une prépublication arXiv (v1), non évaluée par les pairs. Le code, les jeux de données et d'éventuels tests hors simulation seront les vrais juges de la portée du système.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D
2arXiv cs.RO 

Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D

Une équipe de recherche présente un framework open source de navigation sémantique piloté par le langage naturel pour robots mobiles, publié sur arXiv (2607.13624v1). Le système, bâti sur des composants modulaires ROS 2, traduit des requêtes en langage naturel comme "va vers la boîte aux lettres" en objectifs de navigation exécutables. Concrètement, le pipeline identifie l'objet cible mentionné dans la phrase, estime sa position dans l'espace à partir de données RGB-D, puis génère un point de navigation transmis à la pile Nav2 de ROS 2 pour l'exécution autonome. Les auteurs ont validé l'approche à la fois en simulation et en conditions réelles, sur deux plateformes distinctes : un TurtleBot3 Waffle et un Unitree Go2 équipé d'une caméra RealSense. Le code sera publié en open source après acceptation de l'article. Cette architecture illustre une tendance de fond dans la robotique mobile : le passage d'une navigation pilotée par coordonnées ou par carte à une navigation pilotée par l'intention exprimée en langage naturel, sans expertise technique requise de l'utilisateur. Pour les intégrateurs, l'intérêt réside moins dans la performance brute que dans la portabilité : en s'appuyant sur ROS 2 et sur des topics et services standardisés, le framework promet une adaptation à différentes plateformes robotiques via une simple reconfiguration plutôt qu'un développement spécifique par robot. Le système va au-delà des commandes directes en interprétant aussi des requêtes contextuelles et en générant du feedback en langage naturel, deux capacités clés pour une interaction homme-robot fluide dans des environnements domestiques ou logistiques où les utilisateurs finaux ne sont pas des opérateurs formés. Ce travail s'inscrit dans la vague plus large des architectures vision-langage-action qui traversent la robotique depuis l'essor de modèles comme Pi-0 ou GR00T N2, même si ceux-ci ciblent surtout la manipulation plutôt que la navigation pure. Plutôt qu'une approche end-to-end déléguant tout le raisonnement à un modèle unique, les auteurs optent pour une architecture modulaire combinant perception RGB-D, compréhension du langage et planification via Nav2, une pile de navigation déjà largement adoptée dans l'écosystème ROS 2 académique et industriel. L'ambition de portabilité multi-plateforme et la publication annoncée du code positionnent ce travail comme une brique réutilisable plutôt qu'une démonstration isolée, même si, à ce stade, rien n'indique un calendrier de diffusion précis ni des tests en environnements plus complexes ou à grande échelle.

RecherchePaper
1 source
RACO : optimisation de l'objectif grossier tenant compte de la fiabilité pour la navigation vision-langage des drones d'inspection
3arXiv cs.RO 

RACO : optimisation de l'objectif grossier tenant compte de la fiabilité pour la navigation vision-langage des drones d'inspection

Un article publié en août 2026 sur arXiv (référence 2608.22678) présente RACO, un framework de navigation pour drones guidés par instructions en langage naturel (UAV-VLN), pensé pour les missions d'inspection plutôt que pour la simple atteinte d'un objectif, et LG-UVI, un protocole d'évaluation associé dérivé des jeux de données CityNav et CityRefer. Les auteurs pointent une faiblesse des architectures existantes en deux temps ("coarse-to-fine"): l'objectif grossier prédit avant le raffinement local est traité comme fiable alors qu'il peut dériver vers une région plausible mais erronée, ce que l'étape de raffinement fine ne parvient ensuite pas à corriger. LG-UVI ajoute à ces scènes urbaines simulées des objets cibles, des distracteurs visuellement ou sémantiquement proches, des zones d'inspection typées, ainsi que des métriques distinctes pour l'arrivée en zone et pour la confirmation de l'objet. RACO traite l'objectif grossier comme une hypothèse à vérifier en temps réel plutôt qu'un point de passage fixe, en s'appuyant sur des ancres candidates au niveau objet pour corriger la localisation avant la première étape de navigation puis à la frontière entre les deux étapes, avant d'appliquer un raffinement terminal adaptatif pour les cas de quasi-échec en fin de trajectoire. Sous un protocole d'évaluation en ligne unifié, il améliore le taux de succès de 9,53 points de pourcentage sur le jeu de validation "unseen" et de 7,98 points sur le jeu de test "unseen", par rapport à une reproduction de la référence antérieure HETT. Ce résultat touche un point sensible pour l'inspection industrielle par drone: dans un scénario réel de contrôle d'infrastructure, un appareil qui s'arrête devant le mauvais objet mais confirme tout de même une anomalie représente un risque opérationnel plus grave qu'un simple échec de navigation. En montrant qu'une part importante des erreurs vient d'une dérive précoce de l'objectif grossier, non rattrapée par le raffinement local classique, les auteurs remettent en cause l'hypothèse implicite de nombreux pipelines coarse-to-fine selon laquelle l'étape fine peut compenser une estimation grossière imparfaite. Pour les équipes travaillant sur la navigation vision-langage appliquée aux drones d'inspection, l'implication pratique est qu'une vérification explicite et intermédiaire de l'objectif doit être budgétisée, plutôt que de tout reposer sur la puissance du modèle de perception final. Un gain de 8 à 10 points de taux de succès mesuré sur un protocole en ligne unifié, et non sur des scénarios sélectionnés, reste notable dans un domaine où les progrès se comptent généralement en unités de pourcentage. RACO s'inscrit dans la lignée des travaux sur la navigation vision-langage pour drones en environnement urbain simulé, qui s'appuient historiquement sur CityNav et CityRefer pour l'entraînement et l'évaluation. La comparaison se fait face à HETT, une architecture coarse-to-fine antérieure que les auteurs ont reproduite faute de protocole standardisé pour les tâches d'inspection, un manque que LG-UVI vise justement à combler en distinguant l'atteinte d'un objectif générique de la confirmation fiable d'un objet précis en présence de distracteurs. L'article ne mentionne ni déploiement sur drone physique ni partenariat industriel: il s'agit d'une contribution de recherche évaluée en simulation, dont la suite logique serait une validation sur plateforme réelle et une extension à d'autres familles de distracteurs et de zones d'inspection.

RecherchePaper
1 source
PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt
4arXiv cs.RO 

PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt

Des chercheurs ont publié PIGEON (Point of Interest Guided Exploration for Object Navigation), un cadre de navigation robotique pour localiser des objets dans des espaces intérieurs inconnus. L'approche repose sur des modèles vision-langage (VLM), mais résout leur principal obstacle opérationnel : l'inférence dense image par image est trop coûteuse pour un usage embarqué temps réel. PIGEON introduit des Points d'Intérêt (PoI), unités de décision visuelles couplant waypoints géométriques et observations égocentriques brutes, que le VLM utilise pour sélectionner parmi des destinations candidates : frontières d'exploration, objets suspectés, escaliers franchissables, résumés de niveau sol. Un planificateur bas niveau exécute les trajectoires continues entre ces points. Le système intègre un pipeline RLVR (Reinforcement Learning with Verifiable Rewards) permettant d'affiner des VLM locaux sans annotations Chain-of-Thought manuelles. Sur le benchmark Habitat ObjectNav, référence standard en navigation simulée, PIGEON affiche les meilleures performances zero-shot publiées à ce jour et se transfère à la tâche Active Embodied Question Answering par simple modification du prompt. Des déploiements sur robots physiques sont documentés dans le papier (arXiv 2511.13207). L'enjeu central est l'efficacité computationnelle des VLM dans des boucles de contrôle robotique. Les approches concurrentes utilisent soit les VLM comme contrôleurs denses (coûteux), soit pour un simple ranking de frontières d'exploration (sémantiquement appauvri). PIGEON propose un compromis : décisions rares mais ancrées dans les observations brutes, rendant chaque choix vérifiable et compatible avec l'apprentissage par renforcement sans supervision humaine. La réduction de la dépendance aux données annotées est un avantage concret pour des équipes robotiques sans large budget d'annotation. La progression des performances avec la taille du modèle de fondation (scaling) indique une architecture alignée avec les tendances génératives actuelles. La navigation d'objets en environnement inconnu est un benchmark actif en robotique cognitive, avec des systèmes concurrents comme ESC, SG-Nav ou OpenFMNav exploitant également des LLM pour la planification sémantique. PIGEON se différencie par son mode zero-shot strict, sans réentraînement spécifique à l'environnement cible. Habitat, le simulateur d'intérieur de Meta AI Research, reste la plateforme d'évaluation de référence pour ce type de tâche. Ce résultat est académique : aucun partenariat commercial ni déploiement industriel n'est mentionné, et la robustesse en environnements réels dynamiques non contrôlés reste à valider à plus grande échelle. Les prochaines étapes naturelles incluent des tests en milieux variés et l'adaptation à des VLM embarqués contraints en ressources.

RechercheOpinion
1 source