NavGPT-3 : exploiter le contexte dans un environnement d'exécution de navigation hiérarchique
NavGPT-3 est un système de navigation embarquée décrit dans un preprint arXiv (2610.10787) qui associe un grand modèle de langage entraîné par apprentissage par renforcement agentique à long horizon et une politique d'action de type VLA (vision-langage-action), baptisée NavGPT VLA. Le modèle de langage raisonne et planifie, tandis que la politique pilote le mouvement en boucle serrée. Entre les deux, un « harness » fonctionne comme un petit système d'exploitation. Le raisonnement, l'exécution et la supervision tournent en threads séparés, chacun avec son propre contexte, ses outils et ses permissions. Un ordonnanceur décide quel thread contrôle le robot, ce qui permet d'interrompre une action et de changer de thread face à un imprévu. NavGPT VLA a été entraîné sur 19,28 millions d'exemples. Il alloue ses tokens visuels par « codec allocation », proportionnellement au changement de la scène. Seul, son modèle de 8 milliards de paramètres atteint 74,51 de taux de succès (SR) sur R2R-CE et 78,19 SR sur RxR-CE, ce qui le place en tête de ce benchmark. Avec le harness complet, le système monte à 81,51 SR sur R2R-CE. Sur RxR-CE, il obtient 90,43 SR contre 90,4 pour des suiveurs humains, et 78,47 nDTW (fidélité du chemin) contre 77,7. Un épisode dure 1 min 22 s, contre environ 3 min pour un humain.
L'intérêt tient moins au score qu'à l'architecture. Les auteurs affirment que c'est la première fois qu'un agent autonome atteint le niveau humain sur ce benchmark. Surtout, ils chiffrent le gain de réactivité. Quand NavGPT VLA exécute la route, la boucle de raisonnement se raccourcit et le temps de réaction minimal passe de 3 à 19 secondes par décision du modèle de langage à 0,5 à 1 seconde par pas de la politique (1 à 2 Hz). Pour les intégrateurs et les équipes qui déploient des agents embarqués, cela appuie une thèse de plus en plus répandue : les modèles de langage de pointe ne doivent pas piloter directement les moteurs. Il faut une couche d'interface qui délègue le contrôle fin à une politique rapide et garde le LLM pour la décision de haut niveau. Les ablations portent sur la conception du harness et sur l'interaction entre les deux modèles. Elles visent à montrer que cette interface est un levier de performance à part entière, au même titre que la taille des modèles.
Il faut toutefois relativiser. R2R-CE et RxR-CE sont des benchmarks de navigation en environnements simulés (Habitat), à instructions en langage naturel, et non des déploiements sur robot réel. La parité avec l'humain porte sur des métriques de succès et de fidélité de trajectoire, pas sur la robustesse en conditions industrielles. Le temps de 1 min 22 s n'est comparé qu'à une durée humaine approximative. Le travail s'inscrit dans la lignée des NavGPT précédents et dans la vague des modèles VLA de navigation, qui rivalisent avec des approches fondées sur de grands modèles vision-langage. Les auteurs promettent de publier tous les modèles, le code et les enregistrements d'évaluation. Cette ouverture permettra à des tiers de vérifier ces résultats, notamment le gain de réactivité annoncé, avant tout transfert vers des plateformes physiques.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




