Aller au contenu principal
MapNav : une nouvelle représentation mémoire par cartes sémantiques annotées pour la navigation vision-langage
IA physiquearXiv cs.RO 

MapNav : une nouvelle représentation mémoire par cartes sémantiques annotées pour la navigation vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

MapNav est un modèle de navigation guidée par le langage naturel (Vision-and-Language Navigation, VLN) publié sur arXiv (identifiant 2502.13451, version 5). L'idée centrale est de remplacer la mémoire par images historiques, habituellement conservée par les agents VLN pour contextualiser leurs décisions, par une carte sémantique annotée (Annotated Semantic Map, ASM). À chaque épisode de navigation, le système construit une vue de dessus (top-down) de l'environnement, la met à jour à chaque pas de temps, puis y appose des étiquettes textuelles explicites sur les objets et régions clés. Ce flux structuré est ensuite interprété par un modèle vision-langage (VLM) de grande taille dans une architecture end-to-end. Les auteurs annoncent des performances état de l'art sur benchmarks simulés et en environnement réel, et prévoient de publier code source et jeu de données associés.

L'apport principal est architectural : substituer les trames brutes par une carte compacte et annotée réduit la charge mémoire et le coût de calcul, deux obstacles concrets à l'embarquement sur plateformes robotiques à ressources limitées. Les étiquettes textuelles directement inscrites sur la carte transforment une représentation abstraite en signal interprétable par un VLM sans reformater les données brutes, ce qui permet d'exploiter le raisonnement des grands modèles de façon plus directe. La validation en environnement réel, si elle est confirmée par des reproductions indépendantes, représenterait un progrès tangible dans la réduction du sim-to-real gap qui pénalise encore la majorité des agents VLN. Pour les intégrateurs de robots de service (logistique, hospitalier, résidentiel), une représentation aussi compacte facilite l'interfaçage avec des systèmes d'instruction en langage naturel.

La navigation par instruction verbale en environnement inconnu est un problème de référence depuis le benchmark R2R (Room-to-Room, 2018). Les approches récentes (ETPNav, BEVBert, NavGPT) ont progressivement intégré des cartes métriques et des LLM, mais maintiennent souvent une fenêtre d'historique visuel coûteuse. MapNav s'inscrit dans la lignée des méthodes map-centric tout en capitalisant sur les VLM modernes. Cette publication est un preprint arXiv en cinquième révision, sans affiliation industrielle identifiée, et ses revendications SOTA devront être validées sur benchmarks standardisés par des équipes tierces, étape non négligeable dans une littérature VLN où les comparaisons sont souvent contestées.

Dans nos dossiers

À lire aussi

Combler le fossé 2D-3D : une carte sémantique-géométrique hiérarchique pour la navigation vision-langage
1arXiv cs.RO 

Combler le fossé 2D-3D : une carte sémantique-géométrique hiérarchique pour la navigation vision-langage

Des chercheurs ont publié le 31 mai 2026 sur arXiv un article (référence 2606.00095) décrivant HSGM, une carte hiérarchique sémantique-géométrique conçue pour améliorer la navigation d'agents robotiques guidés par instructions en langage naturel. Le système repose sur une représentation top-down multi-couches organisée en trois niveaux : un niveau géométrique qui encode les zones navigables et les obstacles, un niveau sémantique qui modélise les objets et leurs relations spatiales, et un niveau décisionnel qui supporte le raisonnement de haut niveau pour la sélection des objectifs. Durant la navigation, le modèle de vision-langage (VLM) joue le rôle de planificateur sémantique : il interprète la carte HSGM pour sélectionner des points de passage géométriquement cohérents, tandis qu'un algorithme de planification de trajectoire classique prend en charge les déplacements locaux sans collision. Pour les instructions longues, le système les décompose en sous-tâches afin d'éviter l'oubli de progression ou les hallucinations sur des horizons temporels étendus. Les expériences sur les benchmarks R2R-CE et RxR-CE montrent que le framework en mode zero-shot atteint des performances à l'état de l'art et surpasse même plusieurs méthodes supervisées. Ce résultat est notable parce qu'il attaque un verrou bien identifié de la robotique embodied : les VLMs comprennent le langage et l'image 2D avec compétence, mais peinent à raisonner en 3D et à modéliser la causalité entre actions et transitions spatiales. En convertissant la géométrie 3D en une représentation structurée lisible par les VLMs, HSGM découple proprement le raisonnement sémantique de l'exécution motrice, une architecture qui pourrait simplifier l'intégration de LLMs généralistes dans des chaînes de contrôle robotique existantes sans retraining complet. La performance zero-shot supérieure à certaines méthodes supervisées suggère une généralisation robuste à des environnements inconnus, ce qui est directement pertinent pour des déploiements en entrepôt, bâtiment tertiaire ou environnement hospitalier où l'annotation préalable est coûteuse. Ce travail s'inscrit dans un champ de recherche actif sur la navigation embodied guidée par langage, avec des benchmarks de référence établis notamment par Anderson et al. (R2R, 2018) et leurs extensions continues (R2R-CE pour les environnements continus, RxR-CE multilingue). La tendance de fond est à l'utilisation de VLMs pré-entraînés comme raisonneurs généraux plutôt que de former des architectures dédiées depuis zéro, une approche défendue aussi par des équipes comme CMU, Oxford ou Google DeepMind sur des problèmes adjacents. La prochaine étape naturelle pour ce type de système est l'intégration sur des plateformes physiques réelles, domaine où le sim-to-real gap reste un défi ouvert que les benchmarks en simulation ne mesurent pas. Le code est disponible publiquement sur GitHub (Teacher-Tom/HSGM\_public), ce qui facilite la reproduction et l'adaptation par des équipes tierces.

IA physiqueOpinion
1 source
GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action
2arXiv cs.RO 

GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action

Des chercheurs ont publié GesVLA, un modèle Vision-Language-Action augmenté d'une modalité gestuelle, dans un preprint arXiv soumis en mai 2026 (arXiv:2605.22812). L'architecture repose sur un double VLM (Vision-Language Model) qui encode les features gestuelles directement dans l'espace latent, permettant aux gestes pointés de la main de participer à la fois au raisonnement de haut niveau et à la génération d'actions motrices. Pour l'entraînement, l'équipe a construit un pipeline de génération de données synthétiques en rendant des modèles 3D de mains sur des images de scènes réelles, produisant des annotations de pointage variées tout en réduisant le sim-to-real gap visuel. Le modèle a été évalué sur plusieurs tâches physiques réelles : manipulation contrôlée de blocs et sélection de produits dans des environnements encombrés. Les expériences montrent une amélioration mesurée de la précision de grounding cible et de l'efficacité de l'interaction humain-robot, particulièrement dans des scènes complexes avec objets similaires. L'apport principal de GesVLA est d'adresser une faiblesse connue des VLA actuels : l'ambiguïté spatiale. Quand plusieurs objets similaires sont présents dans la scène, une instruction textuelle seule (type "prends la bouteille") reste ambiguë. Intégrer le geste de pointage comme modalité parallèle au texte offre un ancrage spatial explicite sans modifier l'interface verbale. L'architecture dual-VLM représente un choix architectural non trivial par rapport aux approches qui traitent les modalités de façon séquentielle. Ce n'est pas la première tentative d'incorporer des signaux humains dans les VLA, mais la formalisation du geste comme modalité de premier rang dans l'espace latent, plutôt qu'en post-processing, est une contribution d'architecture à surveiller pour les intégrateurs qui déploient des cobots en environnements de picking désordonnés. GesVLA s'inscrit dans la vague de recherche post-RT-2 et pi-0 qui cherche à rendre les VLA robustes au-delà du régime de laboratoire. Les modèles concurrents comme OpenVLA (Berkeley), Octo ou RoboFlamingo travaillent essentiellement avec du texte et de la vision, sans modalité gestuelle native. Physical Intelligence (pi) avec pi-0 et Google DeepMind avec RT-2/RT-X restent les références industrielles sur la généralisation des VLA à grande échelle. Le preprint ne mentionne pas de partenariat industriel ni de timeline de déploiement commercial. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés (LIBERO, Calvin) pour permettre des comparaisons directes, et une intégration sur des plateformes comme Franka ou UR5 au-delà des configurations de démonstration présentées.

IA physiqueOpinion
1 source
FreqNav : routage fréquentiel par étapes pour la navigation aérienne vision-langage orientée objets
3arXiv cs.RO 

FreqNav : routage fréquentiel par étapes pour la navigation aérienne vision-langage orientée objets

Un papier arXiv (2608.00970v1) présente FreqNav, un framework léger de navigation aérienne guidée par le langage pour des drones devant localiser et se poser précisément sur une cible décrite en langage naturel. Le problème identifié est que les méthodes VLN existantes traitent les tokens visuels de façon identique tout au long du vol, alors que les besoins perceptifs évoluent : exploration initiale centrée sur les basses fréquences (structure spatiale globale) puis, à l'approche, bascule vers les hautes fréquences (détails fins de la cible). FreqNav répond à ce constat via trois briques sous budget de calcul fixe : un Frequency Token Router qui réalloue dynamiquement les tokens visuels entre composantes fréquentielles selon la phase de vol, un Phase-dépendent Grounding Module qui ancre l'évidence visuelle par supervision explicite, et un Diffusion Transformer qui prédit des trajectoires continues pour le contrôle en boucle fermée. Les auteurs rapportent des performances supérieures aux méthodes de référence, avec une inférence environ 3 fois plus rapide, et des tests en conditions réelles pour valider l'approche au-delà de la simulation. L'intérêt principal ici est l'efficacité computationnelle plutôt que la performance brute : un gain de 3x en vitesse d'inférence à budget de calcul constant est significatif pour l'embarqué sur drone, où puissance de calcul et latence sont des contraintes dures pour le contrôle en temps réel. Cela s'inscrit dans une préoccupation centrale du secteur VLA (vision-language-action) : la plupart des modèles massifs fonctionnent bien en simulation ou sur serveur déporté mais restent difficiles à faire tourner en boucle fermée sur du matériel embarqué limité. Une architecture qui adapte dynamiquement l'allocation de ressources visuelles selon le contexte de la tâche, plutôt que de traiter tous les tokens uniformément, est une piste concrète pour réduire ce fossé entre démonstration et déploiement réel, en particulier pour les drones d'inspection industrielle ou de recherche-sauvetage où l'autonomie longue portée et la précision d'atterrissage comptent. Ce travail s'inscrit dans la lignée des recherches VLN (vision-and-language navigation) qui étendent aux drones les progrès obtenus en manipulation robotique avec les modèles VLA génériques. Il ne s'agit pas d'un produit commercial ni d'une annonce industrielle mais d'une contribution académique publiée sur arXiv, avec du code et des expériences reproductibles a priori plutôt qu'un déploiement à grande échelle. La mention de tests "real-world" dans l'abstract reste à interpréter avec prudence tant que les conditions exactes (nombre de vols, environnements, taux de réussite détaillé) ne sont pas précisées dans le corps du papier. Les prochaines étapes attendues pour ce type de recherche sont la publication du code, des comparaisons plus larges avec d'autres architectures de routing fréquentiel ou de VLA aérien, et une éventuelle reprise par des acteurs industriels du drone si les gains d'efficacité se confirment à plus grande échelle.

IA physiqueActu
1 source
Vert pour avancer, rouge pour s'arrêter : ancrage visuel par segmentation sémantique pour la navigation VLA
4arXiv cs.RO 

Vert pour avancer, rouge pour s'arrêter : ancrage visuel par segmentation sémantique pour la navigation VLA

Une équipe de recherche propose une méthode pour améliorer la fiabilité des modèles vision-langage-action (VLA) utilisés en navigation robotique, en s'appuyant sur la segmentation sémantique en temps réel. Le système utilise SegFormer pour colorer l'image perçue par le robot: en vert les zones traversables, en rouge les zones à éviter, avant de transmettre cette image enrichie au modèle de navigation OmniVLA. Deux variantes ont été testées, une segmentation appliquée uniquement à l'observation courante, et une seconde appliquée conjointement à l'observation et à l'image ou l'instruction cible. Sur le jeu de données Grand Tour, cette technique de "grounding" visuel réduit l'erreur moyenne de trajectoire au point de passage le plus éloigné de 27 à 44%, un gain qui varie selon la longueur de l'instruction donnée au robot. Les auteurs montrent aussi, via une analyse d'erreur normalisée, que le bénéfice provient surtout d'un raccourcissement de 30% de la longueur de trajectoire prédite, plutôt que d'un raisonnement spatial réellement amélioré par unité de distance. Pour les intégrateurs et ingénieurs qui déploient des robots mobiles guidés par instructions en langage naturel, ce résultat est notable car il ne nécessite aucun réentraînement du modèle VLA existant, seulement une couche de traitement d'image ajoutée en amont, peu coûteuse en calcul. Les auteurs sont transparents sur les limites: le gain est quasi nul pour les instructions basées sur une image cible plutôt qu'un texte, et la méthode ne compense pas l'absence de signal d'entraînement pour des instructions hors distribution. Cela confirme un écart connu du secteur entre performance démonstrative et robustesse réelle des modèles de navigation par langage. OmniVLA s'inscrit dans la famille grandissante des modèles vision-langage-action pour la navigation, aux côtés d'approches comme Pi-0 ou GR00T N2 développées pour la manipulation et le déplacement robotique. Le travail présenté ici, une première évaluation empirique du grounding visuel appliqué spécifiquement à ces politiques de navigation, ouvre la voie à des ajouts similaires et légers sur d'autres architectures VLA sans passer par un réentraînement complet, une piste pratique pour fiabiliser des déploiements réels en environnement encombré ou ambigu.

IA physiqueActu
1 source