SkillNav : intervention par compétence au niveau des scores pour la navigation zero-shot vers un objet
Une équipe de recherche publie SkillNav, un framework de navigation pour agents basés sur des modèles vision-langage (VLM), destiné à la navigation zero-shot vers un objet cible (object-goal navigation). Le système exploite la carte de valeurs de curiosité déjà maintenue par les navigateurs VLM modernes comme support inscriptible sur lequel des compétences comportementales modulaires s'ajoutent sans coût de tokens supplémentaire. Ces compétences sont organisées en trois niveaux d'autorité croissante : le réglage souple (pondération proportionnelle), le renforcement de borne inférieure (garanties au niveau des régions) et le remplacement forcé (actions imposées par seuil), combinés selon un ordre de composition fixe. Le système est entraîné une fois sans réentraînement additionnel (training-free) et établit de nouveaux records sur trois benchmarks de référence : un score SPL de 25,5 sur MP3D, 39,3 sur HM3D v0.1 et 43,2 sur HM3D v0.2, soit une amélioration allant jusqu'à 6,0 points par rapport à la meilleure méthode antérieure, avec les meilleurs taux de réussite observés (69,7 % sur HM3D v0.1 et 75,9 % sur HM3D v0.2).
L'enjeu dépasse la simple compétition de benchmarks : les agents de navigation basés sur des VLM en mode zero-shot souffrent typiquement d'un raisonnement image par image, sans mémoire comportementale entre les étapes, ce qui provoque des blocages en cul-de-sac, des boucles dans une même pièce ou des trajectoires détournées vers une cible pourtant détectée. Les correctifs existants, fondés sur l'ajout d'instructions textuelles, alourdissent le budget de tokens et peinent à encoder des signaux intrinsèquement spatiaux comme les angles ou les coordonnées de vue. En inscrivant la mémoire directement sur la carte spatiale plutôt que dans le prompt, SkillNav propose une piste pour améliorer les capacités de navigation par simple ajout de nouvelles compétences, sans retoucher le modèle VLM sous-jacent ni perturber les comportements déjà en place.
Ce travail s'inscrit dans la lignée des recherches récentes sur la navigation d'objets sans apprentissage spécifique, où les VLM généralistes sont mobilisés directement comme moteurs de décision pour des robots ou agents simulés, en s'appuyant sur des jeux de données de référence comme Matterport3D (MP3D) et Habitat-Matterport 3D (HM3D). L'approche se positionne face aux méthodes de navigation par prompt engineering, jugées coûteuses en tokens et limitées pour représenter l'espace. En proposant une architecture extensible où chaque nouvelle compétence s'enregistre indépendamment, les auteurs ouvrent la voie à un raffinement continu du comportement de navigation, sans les cycles de réentraînement habituellement nécessaires pour intégrer de nouvelles capacités.



