C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot
Publié sur arXiv le 15 septembre 2026 (2609.15142), C2Nav est un framework de navigation vision-langage zero-shot pour environnements continus (VLN-CE), sans entraînement supplémentaire. Trois modules le composent : Seeing élit par comparaison ordinale une vue parmi des candidates validées physiquement ; Remembering maintient un croquis de route et compare les hypothèses d'étapes d'instruction voisines ; Arriving combine une échelle d'hésitation, une comparaison rétrospective et un retour en arrière révocable pour décider l'arrêt. Sur le protocole public OpenNav R2R-CE 100, C2Nav avec Qwen3-VL-8B-Instruct obtient 41,0% de taux de réussite oracle (OSR), 31,0% de taux de réussite (SR) et 16,7% de SPL, le taux pondéré par la longueur du trajet ; avec GPT-5.5, ces scores montent à 54,0%, 44,0% et 29,0%. Sans Seeing, Remembering ou Arriving, le SR tombe respectivement à 14,0%, 25,0% et 29,0% ; remplacer les réponses comparatives par des questions cardinales le réduit à entre 12,0% et 28,0% selon l'étape du trajet.
L'apport tient à l'interface entre modèle et robot plutôt qu'au modèle seul. La plupart des systèmes VLN-CE font produire au VLM des sorties cardinales, points de passage, pixels, caps, décisions d'arrivée absolues, couplant une réponse générative incertaine à une magnitude géométrique ou à un engagement irréversible. C2Nav inverse cette logique : le VLM compare des alternatives déjà construites par le contrôleur, tandis que géométrie, seuils et exécution restent du côté physique du robot. Les résultats montrent qu'une interface décisionnelle contrainte et un raisonnement de VLM plus puissant sont complémentaires et non substituables, ce qui suggère aux intégrateurs un gain de fiabilité accessible sans fine-tuning, par simple reformulation des questions posées au modèle.
Le travail s'inscrit dans la navigation vision-langage en environnement continu, où l'essor des VLM généralistes pousse les chercheurs à les insérer directement dans la boucle de commande, souvent en zero-shot pour éviter un entraînement dédié à chaque environnement. C2Nav se positionne face aux architectures existantes exigeant des sorties géométriques directes, en s'appuyant sur deux VLM distincts, Qwen3-VL-8B-Instruct en version compacte et GPT-5.5 en référence plus puissante, évalués sur le protocole public OpenNav R2R-CE 100. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans intégration dans un robot commercial ni déploiement réel, et sans suite annoncée par les auteurs.
Dans nos dossiers




