Aller au contenu principal
RecherchearXiv cs.RO 

NavGPT-3 : exploiter le contexte dans un environnement d'exécution de navigation hiérarchique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

NavGPT-3 est un système de navigation embarquée décrit dans un preprint arXiv (2610.10787) qui associe un grand modèle de langage entraîné par apprentissage par renforcement agentique à long horizon et une politique d'action de type VLA (vision-langage-action), baptisée NavGPT VLA. Le modèle de langage raisonne et planifie, tandis que la politique pilote le mouvement en boucle serrée. Entre les deux, un « harness » fonctionne comme un petit système d'exploitation. Le raisonnement, l'exécution et la supervision tournent en threads séparés, chacun avec son propre contexte, ses outils et ses permissions. Un ordonnanceur décide quel thread contrôle le robot, ce qui permet d'interrompre une action et de changer de thread face à un imprévu. NavGPT VLA a été entraîné sur 19,28 millions d'exemples. Il alloue ses tokens visuels par « codec allocation », proportionnellement au changement de la scène. Seul, son modèle de 8 milliards de paramètres atteint 74,51 de taux de succès (SR) sur R2R-CE et 78,19 SR sur RxR-CE, ce qui le place en tête de ce benchmark. Avec le harness complet, le système monte à 81,51 SR sur R2R-CE. Sur RxR-CE, il obtient 90,43 SR contre 90,4 pour des suiveurs humains, et 78,47 nDTW (fidélité du chemin) contre 77,7. Un épisode dure 1 min 22 s, contre environ 3 min pour un humain.

L'intérêt tient moins au score qu'à l'architecture. Les auteurs affirment que c'est la première fois qu'un agent autonome atteint le niveau humain sur ce benchmark. Surtout, ils chiffrent le gain de réactivité. Quand NavGPT VLA exécute la route, la boucle de raisonnement se raccourcit et le temps de réaction minimal passe de 3 à 19 secondes par décision du modèle de langage à 0,5 à 1 seconde par pas de la politique (1 à 2 Hz). Pour les intégrateurs et les équipes qui déploient des agents embarqués, cela appuie une thèse de plus en plus répandue : les modèles de langage de pointe ne doivent pas piloter directement les moteurs. Il faut une couche d'interface qui délègue le contrôle fin à une politique rapide et garde le LLM pour la décision de haut niveau. Les ablations portent sur la conception du harness et sur l'interaction entre les deux modèles. Elles visent à montrer que cette interface est un levier de performance à part entière, au même titre que la taille des modèles.

Il faut toutefois relativiser. R2R-CE et RxR-CE sont des benchmarks de navigation en environnements simulés (Habitat), à instructions en langage naturel, et non des déploiements sur robot réel. La parité avec l'humain porte sur des métriques de succès et de fidélité de trajectoire, pas sur la robustesse en conditions industrielles. Le temps de 1 min 22 s n'est comparé qu'à une durée humaine approximative. Le travail s'inscrit dans la lignée des NavGPT précédents et dans la vague des modèles VLA de navigation, qui rivalisent avec des approches fondées sur de grands modèles vision-langage. Les auteurs promettent de publier tous les modèles, le code et les enregistrements d'évaluation. Cette ouverture permettra à des tiers de vérifier ces résultats, notamment le gain de réactivité annoncé, avant tout transfert vers des plateformes physiques.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

EvoNav-Bench : évaluer la navigation continue dans des environnements évolutifs
1arXiv cs.RO 

EvoNav-Bench : évaluer la navigation continue dans des environnements évolutifs

Des chercheurs présentent EvoNav-Bench, un banc d'essai conçu pour évaluer la navigation "lifelong" (LN) des agents robotiques dans des environnements qui changent au fil du temps, détaillé dans une version révisée déposée sur arXiv (identifiant 2609.08292v2). Construit sur le framework de génération procédurale ProcTHOR et étendant le format GOAT-Bench devenu la référence pour ce type de tâche, ce benchmark introduit des modifications de l'environnement entre les sous-tâches de navigation qu'un même agent doit résoudre séquentiellement dans un lieu donné. Les auteurs y testent trois méthodes récentes qui construisent et réutilisent des représentations persistantes de scène, comme des graphes de scène ou des captures visuelles, pour éviter de ré-explorer un lieu déjà visité. Ils comparent aussi trois stratégies heuristiques de gestion du changement : Frontier-Update, Fail-then-Update et Stage-Reset. Résultat principal : les méthodes existantes se révèlent fragiles dès que l'environnement évolue entre deux tâches. L'enjeu dépasse le simple exercice académique. La plupart des systèmes de navigation "lifelong" actuels supposent un environnement statique, alors que dans un entrepôt, un hôpital ou un domicile, des objets sont déplacés, des portes ouvertes ou fermées, des meubles réarrangés par l'activité humaine. Les benchmarks existants ne révélaient pas ce mode de défaillance : un agent peut fusionner sans discernement des observations obsolètes avec de nouvelles données, dégradant sa fiabilité sans que rien ne l'alerte. Pour les intégrateurs travaillant sur des robots de service ou de logistique s'appuyant sur des mémoires de scène persistantes, ce travail suggère que la simple accumulation d'expérience ne suffit pas : il faut des mécanismes explicites de détection et de mise à jour des changements, sous peine de dégrader la navigation au lieu de l'améliorer. Ce banc d'essai s'inscrit dans la continuité des travaux sur la navigation "goal-oriented" en environnements intérieurs simulés, où ProcTHOR et GOAT-Bench servent de fondations standards à la communauté de recherche en robotique embarquée. Aucun acteur commercial ni robot physique n'est impliqué ici : il s'agit d'un outil d'évaluation destiné aux laboratoires développant des agents de navigation. Les stratégies heuristiques proposées, plutôt que des solutions abouties, offrent une base de comparaison pour de futurs agents dotés de mécanismes d'adaptation plus sophistiqués aux changements de scène.

RecherchePaper
1 source
NaviMaster : un modèle unifié pour la navigation dans les interfaces graphiques et dans les environnements physiques
2arXiv cs.RO 

NaviMaster : un modèle unifié pour la navigation dans les interfaces graphiques et dans les environnements physiques

NaviMaster (arXiv:2508.02046, version 4 du preprint) est un agent d'intelligence artificielle qui unifie dans un seul modèle deux types de navigation habituellement traités séparément : la navigation en interface graphique (GUI, pilotage d'applications et de menus) et la navigation embodied (déplacement d'un agent physique ou simulé dans un espace 3D). Le système repose sur l'observation que ces deux problèmes se formulent comme des Processus de Décision Markoviens (MDP), ce qui autorise une architecture et un entraînement communs. NaviMaster introduit trois contributions techniques : un pipeline de collecte de trajectoires à cible visuelle applicable aux deux domaines via une formulation unifiée, un cadre d'apprentissage par renforcement (RL) entraîné sur données mixtes pour améliorer la généralisation, et une récompense dite "distance-aware" conçue pour accélérer l'apprentissage à partir des trajectoires collectées. Évalué sur des benchmarks hors-domaine, il surpasse les agents spécialisés de l'état de l'art sur trois tâches : navigation GUI, prédiction d'affordance spatiale et navigation embodied. Les codes, données et checkpoints sont publiés en open source. L'intérêt de NaviMaster est moins dans ses performances brutes sur chaque tâche isolée que dans la démonstration que GUI et navigation physique peuvent partager une même représentation apprise. Jusqu'ici, ces deux domaines s'appuyaient sur des datasets distincts, des architectures incompatibles et des paradigmes d'entraînement divergents. Pour les équipes travaillant sur des modèles VLA (Vision-Language-Action) ou sur des systèmes multi-tâches, c'est une preuve de concept que la généralisation cross-domaine par RL mixte est faisable à cette échelle. Les études d'ablation publiées confirment que la stratégie de mélange de données et la récompense distance-aware contribuent toutes deux de manière mesurable aux gains finaux, ce qui renforce la crédibilité des choix architecturaux au-delà du résultat global. NaviMaster s'inscrit dans une dynamique de convergence croissante entre agents logiciels et agents physiques. Il se positionne face à des agents GUI spécialisés comme CogAgent ou SeeAct d'un côté, et à des modèles de navigation embodied comme RT-2 ou OpenVLA de l'autre. Les benchmarks de référence sont Web-Arena et OSWorld pour le versant GUI, Habitat pour le versant physique. La présence d'une version v4 sur arXiv signale un processus de révision actif, probablement en direction d'une conférence majeure (ICLR, NeurIPS ou ICRA). L'article ne mentionne aucun déploiement industriel ni partenariat, ce qui place NaviMaster au stade de la preuve de concept académique.

RechercheOpinion
1 source
GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus
3arXiv cs.RO 

GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus

Des chercheurs ont évalué GPT-6-Astra comme agent de navigation dans un système zero-shot de Vision-and-Language Navigation en environnements continus (VLN-CE), où le modèle interprète des instructions en langage naturel, observe son environnement et propose des actions de déplacement. Le système s'appuie sur un cycle observation-décision-exécution avec des appels directs à l'API du modèle, sans harnais d'agent package ni fine-tuning spécifique à la navigation : chaque requête reçoit un sous-ensemble d'observations visuelles, un retour d'exécution des actions précédentes et un historique de progression conservé. L'étude, publiée sur arXiv (2609.20116), porte sur 50 des 100 épisodes val-unseen du benchmark R2R-CE utilisés par le système de référence Open-Nav. Résultats obtenus : taux de réussite de 52,0 %, SPL (Success weighted by Path Length) de 48,9 % et nDTW (normalized Dynamic Time Warping) de 70,8 %. À l'arrêt, 36,0 % des épisodes réussissent via un signal STOP validé par le workflow, et 16,0 % supplémentaires atteignent seulement le critère de distance, à la limite du nombre de pas autorisés. Cette évaluation illustre à la fois le potentiel et les limites d'un grand modèle multimodal utilisé tel quel comme agent de navigation, sans entraînement dédié à la tâche. L'analyse des réponses montre que le modèle relie correctement repères visuels et actions passées aux instructions fournies, et qu'il sait demander des vues supplémentaires ou revenir sur un jugement incertain, un comportement de raisonnement explicite rarement documenté avec ce niveau de détail. Mais l'écart mis en évidence entre compréhension locale et achèvement autonome de la tâche, par exemple un franchissement reconnu comme inachevé alors que le modèle continue de pivoter sur lui-même, pointe une faiblesse structurelle : savoir qu'une action est correcte ne suffit pas à produire un comportement cohérent jusqu'à l'arrêt. Pour les intégrateurs qui envisagent des LLM généralistes pour piloter des robots mobiles ou des AMR, ce résultat tempère l'idée que les modèles zero-shot actuels suffisent en production, d'autant que l'échantillon reste limité à 50 épisodes. Le protocole reprend le sous-ensemble d'épisodes de validation R2R-CE (Room-to-Room en environnements continus) déjà utilisé par Open-Nav, système de navigation antérieur servant de point de comparaison implicite. L'approche se distingue des architectures VLA spécialisées, entraînées de bout en bout sur des données de navigation, en testant directement les capacités générales d'un modèle multimodal via son API, sans fine-tuning ni harnais logiciel dédié. Les auteurs présentent ce travail comme une analyse comportementale plutôt qu'une revendication de performance record, en documentant précisément où le raisonnement du modèle réussit et où il échoue à se traduire en actions physiques cohérentes jusqu'à l'arrêt. Aucun déploiement réel ni produit commercial n'est annoncé : il s'agit d'une évaluation de recherche en preprint, dont les résultats invitent à des travaux futurs sur le contrôle de la terminaison des épisodes et sur l'articulation entre jugement local et planification de trajectoire à plus long terme.

RechercheActu
1 source
MemoGuard : un environnement d'exécution adaptatif contre les pièges mémoriels en navigation robotique à communication limitée
4arXiv cs.RO 

MemoGuard : un environnement d'exécution adaptatif contre les pièges mémoriels en navigation robotique à communication limitée

MemoGuard, un runtime léger développé pour sécuriser la navigation robotique en environnement à communication limitée, vient d'être présenté dans un article de recherche publié sur arXiv (arXiv:2607.15589v1). Le système cible les robots déployés en mission critique, inspection de sites dangereux ou recherche et sauvetage, qui doivent prendre des décisions embarquées fiables sans accès à un opérateur distant ni à des services de raisonnement haute capacité. L'approche s'attaque à un problème spécifique : la réutilisation de mémoire épisodique, technique de secours à faible coût, peut produire des "pièges mémoriels" (memory traps), des actions passées qui semblent correspondre au contexte actuel par similarité mais s'avèrent invalides à l'exécution, à cause d'une topologie modifiée, d'une marge de batterie insuffisante ou d'un historique de résultats peu fiable. Testé dans un simulateur d'inspection de corridors basé sur graphes, MemoGuard réduit de 76,6% les violations de sécurité liées à la batterie par rapport à une réutilisation par similarité simple, tout en diminuant de 21,4% le nombre d'appels au raisonnement de secours comparé à une stratégie qui invoquerait systématiquement ce raisonnement. Sur une carte NVIDIA Jetson AGX Xavier avec un modèle local llama3.2:3b comme mécanisme de repli, cela se traduit par une économie de 3,67 secondes et 36,97 joules par essai. Le code est disponible en open source sur GitHub. L'enjeu dépasse le cas d'usage ponctuel : il touche à un compromis fondamental entre sécurité et efficacité énergétique pour tout robot autonome opérant hors ligne. Toujours invoquer le raisonnement local améliore la sécurité mais coûte cher en calcul et en énergie, une contrainte critique pour des plateformes embarquées à batterie limitée comme les drones d'inspection ou les robots de recherche en zone sinistrée. À l'inverse, se fier uniquement à la similarité de récupération mémorielle minimise le coût mais expose à des erreurs dangereuses. MemoGuard propose une troisième voie, validant les épisodes mémoriels contre des contrats de topologie, de ressources et de résultats avant réutilisation, et n'invoquant le raisonnement de secours qu'en cas d'échec de validation. Pour les intégrateurs et concepteurs de systèmes robotiques autonomes déployés sur le terrain, ce type d'architecture adaptative pourrait devenir un composant standard dès lors que la mémoire épisodique est utilisée comme mécanisme de repli économique. Ce travail s'inscrit dans la lignée des recherches sur les architectures hybrides mémoire-raisonnement pour la robotique embarquée, où l'enjeu est de combiner rapidité d'exécution et fiabilité sans dépendre en permanence de modèles de langage lourds. Le choix de llama3.2:3b comme modèle de repli local, plutôt qu'un service cloud, reflète une tendance vers l'inférence embarquée sur du matériel comme le Jetson AGX Xavier, dans des contextes où la connectivité n'est pas garantie. Les auteurs ne précisent pas de calendrier de déploiement réel au-delà du simulateur de corridors et du code désormais public sur GitHub, ce qui place pour l'instant cette contribution du côté de la recherche méthodologique plutôt que du produit prêt à l'emploi.

RecherchePaper
1 source