Aller au contenu principal
SuperMap : un système SLAM spatio-temporel pour la navigation vision-langage
RecherchearXiv cs.RO 

SuperMap : un système SLAM spatio-temporel pour la navigation vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La recherche présentée sous la référence arXiv:2608.22896v1 introduit SuperMap, un système de cartographie spatio-temporelle en quatre dimensions destiné à la navigation robotique guidée par le langage. Le système combine un module SLAM géométrique à haute fréquence avec une perception asynchrone en vocabulaire ouvert, c'est-à-dire capable de reconnaître des objets sans liste de catégories prédéfinie, grâce aux modèles de fondation actuels. Sa contribution centrale est un moteur de cartographie piloté par la cohérence, qui associe et réactive les instances d'objets en 3D tout en mettant à jour une confiance combinée sur l'existence et l'étiquette de chaque élément, afin de préserver des identités stables et d'élaguer les contenus obsolètes lors d'occlusions ou de changements de scène. Le résultat est un graphe de scène 4D interrogeable, conçu pour s'interfacer avec des modèles vision-langage via des requêtes compositionnelles sur la sémantique des objets et leurs relations. Les auteurs valident l'approche sur des benchmarks et sur des robots réels, dans des scènes dynamiques incluant apparition, disparition et déplacement d'objets, avec des études d'ablation et une analyse des temps d'exécution. Le système est publié en open source, avec un site dédié à l'adresse superodometry.com/supermap.

L'enjeu dépasse la simple démonstration technique. Les modèles de fondation offrent une reconnaissance dite « zero-shot » puissante, mais leurs prédictions restent intermittentes et dépendantes du point de vue caméra : intégrées naïvement dans un pipeline de cartographie, elles provoquent une dérive d'identité, où le même objet revu sous un angle différent est traité comme un nouvel élément, et une sémantique qui ne se met plus à jour. Pour les intégrateurs de robots mobiles destinés aux environnements humains, entrepôts, bureaux ou domiciles, ce problème conditionne directement la fiabilité d'une navigation langage-guidée sur la durée, au-delà d'une simple démo ponctuelle. SuperMap déplace ainsi le curseur du secteur : le défi n'est plus seulement de faire fonctionner un modèle vision-langage-action, mais de maintenir une représentation du monde cohérente dans le temps.

Le nom du projet, associé au site superodometry.com, suggère une filiation avec des travaux antérieurs en odométrie et SLAM géométrique, ici étendus à une couche sémantique persistante. L'article ne détaille pas de comparatif nommé avec des systèmes concurrents de graphes de scène ouverts, mais la publication complète en open source vise explicitement à fournir à la communauté robotique une base de référence déployable pour la cartographie spatio-temporelle en vocabulaire ouvert, plutôt qu'un simple résultat de recherche isolé.

À lire aussi

SEDualVLN : un système dual à représentation spatiale enrichie pour la navigation vision-langage
1arXiv cs.RO 

SEDualVLN : un système dual à représentation spatiale enrichie pour la navigation vision-langage

Une équipe a publié sur arXiv (2605.17249) SEDualVLN, un cadre de navigation visuo-langagière (VLN) à double système pour guider un agent autonome à partir d'instructions en langage naturel. Le Système 1 est un modèle VLM affiné sur des trajectoires de navigation, enrichi d'une conscience spatiale globale et locale, chargé de générer les actions immédiates. Le Système 2 intègre un MLLM généraliste et un module de cartographie 3D temps réel : il planifie des points de passage à partir de vues aériennes de la carte construite à la volée et d'un flux d'images de chemin rendues. Ce schéma rapide-lent coordonné atteint des performances état-de-l'art sur les benchmarks VLN-CE (VLN in Continuous Environments). L'intérêt de SEDualVLN est de réconcilier deux paradigmes aux défauts complémentaires. Les approches end-to-end peinent sur les trajectoires longues et manquent de raisonnement dynamique : fine-tunées sur des données de navigation, elles mémorisent des comportements sans réellement planifier. Les pipelines zero-shot exploitent des MLLM pré-entraînés sans ré-entraînement, ce qui offre une meilleure généralisation, mais souffre d'un ancrage spatial insuffisant et d'un temps d'inférence élevé. SEDualVLN hybride les deux : le Système 1 conserve la réactivité end-to-end, le Système 2 apporte la planification raisonnée du modulaire. Pour des robots mobiles de service ou des assistants de livraison intérieure, ce type d'architecture ouvre une voie vers des agents capables de suivre des instructions complexes dans des espaces jamais vus à l'entraînement. Le VLN est un sous-domaine actif de l'IA incarnée, avec des benchmarks comme R2R (Room-to-Room) et VLN-CE sur des environnements Matterport3D et Habitat. SEDualVLN s'inscrit dans une tendance à combiner LLM généralistes et modules de cartographie explicites, direction déjà explorée par NavGPT ou MapGPT. Le papier reste un preprint non évalué par les pairs, sans code ni démo publique, ce qui rend la reproduction indépendante difficile à ce stade. La prochaine étape naturelle est une validation sur robot physique : toutes les expériences rapportées restent pour l'instant confinées à la simulation.

RechercheOpinion
1 source
TS-Mask VLA : masquage spatio-temporel 2D pour un modèle vision-langage-action avec pontage efficace
2arXiv cs.RO 

TS-Mask VLA : masquage spatio-temporel 2D pour un modèle vision-langage-action avec pontage efficace

Une équipe de recherche présente TS-Mask VLA, un nouveau modèle vision-langage-action (VLA) destiné à la manipulation robotique, décrit dans un article publié sur arXiv (2607.09818v1). Le système repose sur deux innovations techniques : un expert d'action à diffusion discrète doté d'un mécanisme appelé Bridge Attention, qui permet un conditionnement multi-couches depuis le modèle vision-langage pour générer des actions plus précises et stables, et une stratégie de masquage temporo-spatial en deux dimensions appliquée aux tokens d'action discrets, censée renforcer la compréhension des dépendances entre instants successifs et du couplage entre dimensions de l'action. Sur le benchmark de simulation LIBERO, TS-Mask VLA atteint un taux de réussite moyen de 95,7 %, avec seulement 0,5 milliard de paramètres, un score supérieur à celui de modèles nettement plus volumineux. Sur CALVIN, autre benchmark de référence pour les tâches robotiques longues et séquentielles, il obtient la meilleure longueur de séquence moyenne réussie observée, 4,19, signe d'une bonne tenue sur les scénarios à horizon long. Ce résultat intéresse directement le secteur de la robotique manipulative parce qu'il s'attaque à une limite connue des VLA autorégressifs actuels, qui traitent la génération d'action comme une simple prédiction du token suivant, sans modéliser explicitement la structure temporelle et spatiale des séquences de mouvement ni séparer clairement représentation perceptuelle et action. Si les gains de performance se confirment en dehors des benchmarks académiques, cela indiquerait qu'un modèle nettement plus compact peut rivaliser, voire dépasser, des architectures VLA plus lourdes sur des tâches de manipulation complexes, un argument important pour les intégrateurs cherchant à déployer ces modèles avec des contraintes de calcul embarqué. Il s'agit toutefois pour l'instant d'un travail de recherche validé uniquement sur des benchmarks de simulation (LIBERO, CALVIN) et quelques tâches réelles limitées, sans déploiement industriel ni intégration dans un produit commercial. L'article s'inscrit dans la lignée des travaux récents sur les VLA à diffusion, dans la continuité d'approches comme les modèles de type Pi-0 ou GR00T, sans toutefois s'y comparer directement dans le résumé fourni. Les auteurs annoncent des analyses d'ablation détaillées pour justifier chacun des deux choix de conception.

RechercheActu
1 source
RiverVLN : navigation vision-langage temporelle ancrée par phases pour véhicules de surface sans pilote
3arXiv cs.RO 

RiverVLN : navigation vision-langage temporelle ancrée par phases pour véhicules de surface sans pilote

Un groupe de recherche publie RiverVLN, présenté comme le premier benchmark dédié à la navigation vision-langage (VLN) longue portée pour véhicules de surface sans pilote (USV) évoluant en mouvement continu sur des rivières, accompagné du framework PGT-NAV. Plutôt que de faire correspondre directement une instruction complète à une trajectoire, PGT-NAV découpe l'instruction en une séquence ordonnée de phases sémantiques vérifiables visuellement, et maintient en ligne la phase active grâce à des preuves visuelles et de mouvement. Cet état de progression est fusionné avec l'historique visuel-moteur et un ancrage spécifique à chaque phase pour prédire six incréments de pose locale en SE(2). Le système fonctionne selon une boucle prédiction-exécution-réobservation, où le navire avance vers un point cible, met à jour sa phase et son ancrage, puis replanifie via une couche de sécurité fondée sur une carte. En simulation fermée Unity-ROS, PGT-NAV atteint un taux de réussite moyen de 0,79 et réduit nettement la dérive cumulative de position et de cap par rapport à des références de type GNM et ViNT. Des essais sur des scénarios d'ouverture de pont non vus à l'entraînement, ainsi que des expériences sur USV réel, confirment un transfert de la performance simulée vers un déploiement physique. L'intérêt de ces travaux tient à ce qu'ils déplacent la navigation vision-langage hors de son terrain habituel, les robots d'intérieur ou terrestres, où le langage sert de but statique et le déplacement se résume à des actions discrètes quasi instantanées. Sur une rivière, l'inertie, la manœuvrabilité limitée et la rareté de repères maritimes visuellement ambigus rendent ces hypothèses caduques. En démontrant qu'un ancrage temporel par phases peut tenir sous contrainte de mouvement continu, l'étude ouvre une piste concrète pour l'automatisation fluviale et maritime, l'inspection de voies navigables ou la logistique portuaire, des domaines où les modèles VLA conçus pour l'intérieur échouent généralement. Ce travail s'inscrit dans la lignée des modèles de navigation par apprentissage comme GNM et ViNT, ici utilisés comme lignes de base comparatives plutôt que comme solutions retenues. Il s'agit d'un preprint arXiv, donc d'une contribution de recherche non encore validée par les pairs, et non d'un produit commercial ou d'un déploiement opérationnel à grande échelle. Les auteurs annoncent des essais réels sur USV comme prochaine étape de validation, sans calendrier de mise en production précisé.

RecherchePaper
1 source
LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme
4arXiv cs.RO 

LH-AVLN : un benchmark pour la navigation audio-visuo-langagière à long terme

Des chercheurs présentent LH-AVLN (Long-Horizon Audio-Visual-Language Navigation), un nouveau benchmark pour évaluer des agents de navigation autonome devant accomplir des missions longues combinant vision, langage et audio spatialisé. Contrairement aux benchmarks existants, généralement silencieux et centrés sur un objectif unique, LH-AVLN impose à l'agent une mission globale de deux à quatre objectifs, spécifiés soit par catégorie d'objet, soit par description en langage naturel, soit par image de référence. L'agent navigue dans des environnements intérieurs en 3D à l'aide d'observations RGB-D, de données de pose et de son binaural persistant, les missions pouvant être ordonnées ou non. Les chercheurs ont aussi développé PAG-Nav, un agent de référence sans entraînement (training-free) qui construit une carte sémantique temporelle uniforme et planifie ses déplacements de façon progressive, utilisant le son pour guider la recherche hors champ de vision tout en réservant la confirmation finale d'un objectif à une vérification visuelle et sémantique. Ce travail met en lumière un écart important entre les capacités démontrées par les agents actuels et les exigences de missions longues et multimodales. Les tests montrent que les agents existants, qu'ils soient basés sur la vision-langage, la mémoire ou l'audio-visuel, échouent largement à compléter des missions LH-AVLN dans leur intégralité. Ce constat interroge la solidité réelle des approches de navigation incarnée dès qu'elles sortent du cadre mono-objectif habituel des benchmarks académiques, un signal utile pour les équipes de recherche en robotique mobile et en IA incarnée qui cherchent à évaluer la maturité réelle de leurs systèmes avant tout déploiement. LH-AVLN s'inscrit dans une tendance de fond de la recherche en navigation incarnée, qui délaisse progressivement les tâches ponctuelles pour des scénarios de mission complexes et prolongés, plus proches des besoins réels en robotique de service ou d'inspection. En proposant simultanément des indices sonores persistants, des spécifications d'objectifs hétérogènes et des missions multi-étapes, ce benchmark comble un vide par rapport aux travaux antérieurs en navigation audio-visuelle, généralement focalisés sur un seul objectif. PAG-Nav, présenté comme référence diagnostique plutôt que solution définitive, laisse une marge de progression substantielle, ouvrant la voie à de futurs travaux combinant mieux perception multimodale et planification à long terme.

RecherchePaper
1 source