
NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents
NavHarness, un framework publié sur arXiv (v1), propose d'aborder la navigation vision-langage (VLN) par une architecture à quatre agents spécialisés plutôt que par un seul agent multimodal généraliste. Un Goal Agent fixe des sous-objectifs adaptatifs à partir de l'instruction, de l'observation courante et de l'historique d'exécution. Un Visuomotor Agent exécute les actions de navigation pour atteindre chaque objectif. Un Verify Agent juge ensuite si l'objectif est atteint, grâce à une question de vérification propre à cet objectif. Un Memory Agent compresse enfin l'historique multimodal correspondant, en conservant l'information utile à la suite du trajet. Les auteurs évaluent le système sur les benchmarks simulés R2R-CE et RxR-CE, comparent des variantes sur trois modèles de base et analysent l'évolution du contexte pendant l'exécution. En conditions réelles, NavHarness atteint 83,3 % de succès et 1,51 m d'erreur de navigation sur huit parcours jugés difficiles, chacun parcouru trois fois, soit 24 essais au total.
L'intérêt tient à deux problèmes concrets des agents embarqués pilotés par des modèles multimodaux. Le premier est la dérive sur les tâches longues : choisir une action locale plausible à chaque pas ne garantit pas de rester sur l'itinéraire voulu. La vérification explicite de chaque sous-objectif vise à corriger cette dérive en cours de route. Le second est le coût d'inférence : si l'historique image-texte est réinjecté tel quel à chaque décision, l'entrée grossit sans cesse. Le découpage de l'historique en segments compressés à chaque objectif validé est une réponse d'ingénierie pragmatique, qui concerne directement les intégrateurs soucieux de la latence et du coût de calcul embarqué. Les résultats appellent toutefois de la prudence : l'échantillon réel est restreint (huit parcours, trois passes), la nature des environnements n'est pas détaillée dans le résumé et l'article ne chiffre pas, dans cet extrait, le gain de calcul obtenu.
Ce travail s'inscrit dans la tendance qui consiste à réutiliser des modèles multimodaux généralistes comme base de la navigation, plutôt que d'entraîner des politiques dédiées. R2R-CE et RxR-CE, versions en environnement continu des benchmarks Room-to-Room et Room-across-Room, sont des références habituelles de ce champ. Le texte ne fournit ni comparaison chiffrée avec des méthodes concurrentes, ni robot, ni calendrier de déploiement : il s'agit d'une publication de recherche, pas d'un produit. La suite logique serait de mesurer le système sur davantage d'environnements réels et de quantifier précisément l'économie de contexte apportée par la compression.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




