
VL-LN Bench : vers une navigation orientée objectifs à long horizon avec dialogues actifs
Une équipe de recherche propose Interactive Instance Goal Navigation (IIGN), une nouvelle tâche de navigation robotique où l'agent peut librement interroger un oracle en langage naturel pendant sa recherche d'un objet spécifique, plutôt que de recevoir une instruction figée et non ambiguë comme c'est le cas dans la navigation par instruction classique. Pour évaluer cette capacité, les chercheurs publient VL-LN Bench, un benchmark construit autour d'un pipeline de collecte de données automatisé ayant généré plus de 41 000 trajectoires de dialogue longues et augmentées, destinées à l'entraînement des modèles. Le benchmark inclut aussi un protocole d'évaluation automatique couplé à un oracle dédié capable de répondre aux questions de l'agent en cours de mission. Les expériences menées identifient deux verrous techniques majeurs : l'exploration sur de longs horizons temporels et la capacité à relier finement une information textuelle à la bonne instance parmi des distracteurs de même catégorie visuelle.
Ce travail éclaire un point sensible pour l'industrie de la robotique embarquée : la plupart des agents de navigation actuels, y compris les modèles vision-langage-action (VLA) les plus avancés, fonctionnent bien sur des instructions bien formées mais s'effondrent dès que la consigne devient ambiguë, ce qui est pourtant la norme dans un usage réel en entrepôt, en intérieur domestique ou en environnement industriel non structuré. Les résultats montrent que le dialogue actif atténue partiellement ces limites, mais que l'écart avec la performance humaine reste important, ce qui tempère les annonces de robots capables de "comprendre" des instructions naturelles complexes sans supervision.
IIGN s'inscrit dans la continuité de l'Instance Goal Navigation (IGN), une tâche déjà établie dans la littérature d'IA embarquée, en y ajoutant la dimension conversationnelle qui manquait pour rapprocher les benchmarks académiques des conditions réelles de déploiement. Les auteurs valident également, via des ablations, l'intérêt de leur pipeline de génération de données et montrent que leur oracle automatisé peut se substituer à une supervision humaine à moindre coût, ouvrant la voie à un entraînement à plus grande échelle de ces agents dialogiques.
Dans nos dossiers




