SuperNav : un système de navigation à base d'agents pour toute tâche dans n'importe quelle scène
SuperNav, un système de navigation décrit dans un preprint arXiv (2610.12126) par l'équipe zju3dv de l'université du Zhejiang, vise les robots de service généralistes qui doivent répondre à des demandes humaines variées dans des environnements inconnus. Son principe : un grand modèle de langage multimodal (MLLM) préentraîné est utilisé tel quel, sans fine-tuning spécifique à la navigation. Il est encadré par un « agent harness », c'est-à-dire une couche logicielle composée de compétences de navigation (Navigation Skills), d'outils orientés agent pour l'interaction physique, et d'un module de suivi de progression de la tâche et de gestion du contexte. Une interface unifiée à base de points visuels relie la décision au mouvement : le modèle désigne directement une destination dans l'image, puis révise son choix à partir du retour d'exécution. Les auteurs affirment que SuperNav dépasse quatre méthodes de référence sur des tâches au niveau de l'instance, multi-objets et pilotées par un besoin (« j'ai soif », par exemple). Une évaluation par catégorie sur le jeu HM3D et un déploiement sur un robot quadrupède réel complètent les résultats.
L'enjeu tient à l'architecture. Plusieurs approches récentes ajustent un MLLM pour qu'il prédise directement des actions de navigation, ce qui lie leur comportement à la couverture des données d'entraînement et limite la généralisation à des requêtes ou des lieux nouveaux. SuperNav prend le parti inverse : le modèle garde ses capacités générales de raisonnement et de compréhension de scène, et délègue l'exécution du mouvement à des outils classiques. Si cette séparation tient à grande échelle, elle réduit le coût de collecte de données de navigation et permet de profiter des progrès des modèles de fondation sans réentraînement. Pour un intégrateur, cela rapproche la navigation d'une brique modulaire, où l'on peut changer de modèle ou d'outil de locomotion sans tout reconstruire. Les réserves habituelles s'appliquent toutefois : le résumé ne fournit ni taux de réussite chiffrés, ni latence, ni coût d'inférence, ni nombre d'essais sur le quadrupède. L'écart entre benchmark simulé et terrain reste donc à mesurer, d'autant que l'appel répété à un grand modèle peut être pénalisant en temps réel.
Ce travail s'inscrit dans la tendance des systèmes agentiques en robotique, qui exploitent des MLLM généralistes avec des outils, face aux modèles vision-langage-action (VLA) entraînés de bout en bout. Il s'oppose aux méthodes de navigation fine-tunées sur des données dédiées, qui sont ses comparaisons directes, même si le résumé ne nomme pas les quatre références. Il s'agit d'un preprint académique : il n'y a ni produit, ni calendrier de commercialisation, ni partenaire industriel annoncé. Une page de projet est disponible, et la suite logique serait la publication du code, des tests sur d'autres plateformes mobiles et des évaluations en environnements réels plus longs et plus encombrés, seuls capables de dire si l'approche dépasse le stade de la démonstration de laboratoire.
Dans nos dossiers




