HarnessVLN : unifier la navigation incarnée sans entraînement grâce à un harnais d'agents
Des chercheurs ont publié HarnessVLN, un article arXiv (2609.15195, catégorie "new") qui présente un cadre zero-shot, sans entraînement spécifique, pour la navigation robotique incarnée guidée par instructions en langage naturel. Son composant central, l'Agent Harness, orchestre perception, récupération d'information, ancrage spatial, navigation, récupération d'erreurs et terminaison de tâche via une interface outil unifiée : il confronte chaque proposition du planificateur aux preuves spatiales disponibles, à la faisabilité géométrique et à la cohérence des sous-objectifs, avant de réinjecter ce retour structuré dans la décision suivante. Une mémoire d'événements hiérarchique suit la progression de la tâche et l'historique d'exécution, tandis qu'un graphe spatiotemporel persistant conserve les preuves spatiales réutilisables et les annotations d'échec pour vérification ultérieure. Un exécuteur de navigation interchangeable convertit les cibles validées en mouvements concrets, permettant au même protocole de couvrir à la fois le suivi d'instructions et la navigation vers un objet désigné. Sur les benchmarks R2R, RxR, HM3D-v2 et HM3D-OVON, le système atteint des taux de réussite respectifs de 60,8 %, 53,9 %, 76,0 % et 59,3 %, dépassant les meilleurs résultats "sans entraînement" publiés jusqu'ici. Un déploiement sur robot humanoïde en environnement réel est également démontré.
L'intérêt tient au problème que le cadre cible directement : les grands modèles multimodaux (MLLM) savent générer des plans d'action plausibles à partir d'images, mais rien ne garantit qu'ils tiennent compte de la géométrie réelle du lieu, de l'avancement effectif de la tâche ou des échecs déjà survenus, ce qui produit des trajectoires incohérentes en pratique. En ajoutant une couche de vérification et de mémoire structurée autour du modèle de langage plutôt qu'en le réentraînant, HarnessVLN suggère que l'architecture de contrôle, davantage que le MLLM sous-jacent, conditionne la robustesse d'un agent de navigation. Le fait qu'un seul protocole couvre suivi d'instructions et navigation vers objet, et se transfère à un humanoïde réel, est un signal pertinent pour les intégrateurs évaluant des piles de navigation zero-shot avant d'investir dans du fine-tuning coûteux en données.
Ce travail s'inscrit dans une vague de recherches qui exploitent des MLLM déjà entraînés comme alternative aux politiques VLN classiques, coûteuses à entraîner et peu généralisables hors de leur distribution d'origine. Les benchmarks utilisés, R2R et RxR pour le suivi d'instructions, HM3D-v2 et HM3D-OVON pour la navigation vers objet, sont des références standards du secteur issues des scans Matterport3D et de l'environnement Habitat. La nature exacte de la plateforme humanoïde testée et l'échelle du pilote ne sont pas précisées dans le résumé, ce qui invite à la prudence sur la portée réelle de cette démonstration. La page du projet est accessible à harnessvln.netlify.app.
Dans nos dossiers




