VerNav : navigation vision-langage à faible latence guidée par un vérificateur
Un preprint publié sur arXiv (arXiv:2609.00920v1) présente VerNav, une architecture de navigation vision-langage (VLN) qui vise à réduire la latence de décision des agents basés sur des grands modèles de langage (LLM). Plutôt que de générer une réponse autorégressive complète à chaque étape pour interpréter l'instruction et choisir l'action, comme le font les agents VLN-LLM classiques, VerNav utilise un vérificateur qui évalue par lots les actions candidates, et ne fait appel à un générateur autorégressif, via un déclencheur basé sur l'entropie, que pour les décisions jugées incertaines. L'entraînement combine une phase d'alignement de préférence d'action locale (VPO) et un fine-tuning par renforcement étape par étape avec récompenses de progression. Sur le benchmark Room-to-Room (R2R), la voie "vérificateur seul" de VerNav égale des agents VLN-LLM représentatifs tout en divisant par plus de 10 la latence moyenne de décision par étape.
L'intérêt dépasse la performance brute : le coût de calcul du raisonnement explicite étape par étape est ce qui bloque aujourd'hui le déploiement d'agents VLN-LLM dans des applications robotiques temps réel, robots mobiles autonomes (AMR) en entrepôt ou plateformes de service suivant des instructions vocales. En montrant qu'un vérificateur peu coûteux peut remplacer la génération autorégressive pour la majorité des décisions sans perdre en qualité de raisonnement sur les cas ambigus, VerNav relativise l'idée que raisonnement explicite et faible latence seraient incompatibles en VLN. À noter : les gains annoncés restent des mesures logicielles obtenues en simulation sur R2R, sans validation sur robot physique réel, un point que le preprint ne souligne pas explicitement.
La tâche VLN, qui consiste à faire naviguer un agent dans un environnement 3D inconnu à partir d'instructions en langage naturel, s'appuie depuis des années sur R2R comme benchmark de référence, et a récemment intégré des LLM pour améliorer la compréhension d'instructions et l'ancrage sémantique, au prix d'une latence d'inférence accrue. VerNav se positionne comme une alternative à ces agents VLN-LLM autorégressifs plutôt que comme un produit déployé : le travail est publié en preprint, non revu par les pairs, sans calendrier de déploiement industriel annoncé, et les suites logiques évoquées dans ce type de recherche sont une extension à des benchmarks plus larges comme REVERIE ou RxR.
Dans nos dossiers




