Aller au contenu principal
RecherchearXiv cs.RO 

Une représentation topologique par graphes objet-chemin pour la navigation d'instance à vocabulaire ouvert

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a mis en ligne sur arXiv, fin septembre 2026, un article intitulé "A Topological Representation with Object-Path Graphs for Open-Vocabulary Instance Navigation" (arXiv:2609.24189), proposant une nouvelle représentation appelée object-path graph pour la navigation d'agents robotiques guidée par instructions en langage naturel. Le système unifie raisonnement sémantique en vocabulaire ouvert et navigation topologique dans une structure de graphe légère unique, sans recourir à une reconstruction de carte métrique dense. La stratégie de navigation associe une planification de chemin globale sur ce graphe à une exécution locale entre nœuds, via une localisation légère des nœuds et un asservissement visuel sémantique. Les auteurs rapportent des résultats sur les bancs d'essai de simulation HM3D et Replica, complétés par des expériences sur robot réel, sans préciser la plateforme utilisée ni fournir de comparatif chiffré détaillé.

L'intérêt de ce travail tient au problème qu'il cible: les graphes de scène offrent une mémoire sémantique compacte, mais restent aujourd'hui déconnectés de l'exécution réelle du déplacement, qui dépend encore de cartes métriques denses coûteuses à construire et à maintenir. En couplant ancrage sémantique en vocabulaire ouvert, localisation par graphe et navigation dans un seul cadre topologique léger, l'approche cherche à réduire la dépendance à la cartographie 3D dense et aux calculs de reconstruction associés. C'est un enjeu très concret pour les intégrateurs déployant des robots mobiles ou des humanoïdes dans des environnements non cartographiés ou évolutifs: une navigation fondée sur un graphe léger plutôt que sur du SLAM dense allègerait le calcul embarqué nécessaire pour exécuter des instructions du type "va chercher tel objet dans telle pièce", un axe qui recoupe les ambitions des architectures vision-langage-action actuelles sans s'y substituer directement.

Les méthodes existantes en navigation vision-langage se répartissent globalement entre décomposition séquentielle de décisions guidées par le texte et exploration en ligne sans connaissance préalable des lieux, deux familles limitées respectivement par leur rigidité et leur coût de calcul; les graphes de scène s'étaient imposés comme mémoire sémantique compacte mais sans lien direct avec l'exécution. L'article reste un preprint de recherche démontrant une performance qualifiée de "compétitive" sur des benchmarks standards, non un système prêt au déploiement industriel ni comparé publiquement à des modèles VLA généralistes. Les suites logiques attendues seraient un passage à l'échelle sur des environnements plus vastes et une confrontation directe avec des architectures de navigation concurrentes de plus grande taille.

À lire aussi

SAP-Nav : représentation sémantique spatiale et perception active pour la navigation hiérarchique à vocabulaire ouvert
1arXiv cs.RO 

SAP-Nav : représentation sémantique spatiale et perception active pour la navigation hiérarchique à vocabulaire ouvert

Des chercheurs ont publié sur arXiv (2608.12707v1) SAP-Nav, un framework de navigation robotique zero-shot conçu pour suivre des instructions en langage libre désignant une cible à l'échelle de la scène, de la pièce, de la région ou de l'instance, dans des environnements inconnus (navigation hiérarchique vers des objets à vocabulaire ouvert, ou OVON). Sans entraînement dédié à la tâche ni carte préconstruite, le système bâtit en continu une représentation spatiale sémantique interrogeable à partir des vues de pièces acquises activement par l'agent, et s'appuie sur un module de vérification active du point de vue : si l'observation courante ne fournit pas assez d'indices, l'agent se repositionne vers un emplacement plus informatif avant de confronter les candidats aux contraintes de catégorie et d'attributs. Évalué sur les benchmarks LangMap et HM3D-OVON, SAP-Nav obtient les meilleurs scores globaux, avec un gain de 12,2 points de taux de réussite sur la navigation au niveau région par rapport aux méthodes entraînées spécifiquement. Des tests sur robot réel confirment la faisabilité pratique de l'approche ; le code source ne sera publié qu'après acceptation de l'article. Ce travail répond à une tension classique de la navigation robotique sous observation partielle : l'ancrage spatial exige une mémoire persistante de l'environnement, tandis que la vérification de la cible exige des vues nettes et discriminantes, deux besoins difficiles à concilier simultanément. En misant sur la perception active plutôt que sur un entraînement lourd ou des cartes précalculées, SAP-Nav généralise directement à de nouveaux lieux, un atout pour les robots de service ou les AMR devant exécuter des instructions en langage naturel sans reconfiguration site par site. Le gain annoncé reste toutefois mesuré sur des benchmarks simulés, et la démonstration sur robot réel atteste avant tout une faisabilité technique, pas un déploiement en conditions industrielles. SAP-Nav prolonge LangMap, un travail antérieur qui a formalisé ce cadre hiérarchique en distinguant indices de scène, de pièce, de région et d'instance. Il se positionne comme alternative zero-shot aux méthodes dites "training-based", qui nécessitent un apprentissage spécifique ou des cartes de scène précalculées, tout en restant compatible avec la navigation classique par catégorie. Aucune entreprise ni laboratoire n'est cité dans le résumé, ce qui indique une contribution académique sans partenariat industriel annoncé à ce stade. Les auteurs précisent que le code source sera rendu public uniquement après acceptation de l'article, signe que la publication est encore en cours d'évaluation par les pairs et que la reproduction complète des résultats n'est pas encore possible.

RecherchePaper
1 source
Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense
2arXiv cs.RO 

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense

Des chercheurs ont publié une nouvelle version (v2) de l'article arXiv 2407.09016, qui présente OVExp, un framework d'exploration en vocabulaire ouvert pour la navigation robotique vers des objets-cibles non catégorisés au préalable. Le système s'appuie sur des modèles Dense CLIP pour généraliser la cartographie sémantique, sans recourir à l'inférence coûteuse de grands modèles de langage (LLM) ni à un entraînement intensif par apprentissage par renforcement (RL) de bout en bout. L'innovation centrale est une stratégie de transfert cross-modal sur cartographie sémantique : le réseau apprend d'abord uniquement à partir de texte, puis transfère ces représentations, au moment du test, vers une cartographie multimodale combinant localisation spatiale précise des objets et représentations visuelles généralisables. Les auteurs annoncent une généralisation robuste vers des objets-cibles inédits, validée sur les benchmarks établis d'ObjectNav, malgré un entraînement reposant sur des mises en page textuelles limitées en nombre d'objets. Pour l'industrie robotique et les intégrateurs, ce travail cible un problème concret de coût et de latence : les approches actuelles de navigation en vocabulaire ouvert, qui appellent un LLM à chaque décision ou nécessitent des heures d'entraînement RL par environnement, restent difficiles à déployer à grande échelle sur des robots mobiles autonomes (AMR) ou des plateformes d'inspection. En montrant qu'un réseau de prédiction d'objectifs basé sur une carte sémantique peut généraliser sans réentraînement lourd ni appel LLM en boucle, OVExp propose une alternative aux architectures VLA gourmandes en ressources, ce qui intéresse directement tout acteur cherchant à doter des robots de capacités de recherche d'objets flexibles sans exploser les coûts d'inférence en production. Ce travail s'inscrit dans la lignée des recherches sur ObjectNav, la tâche de navigation vers un objet-cible désigné par catégorie ou par image dans un environnement inconnu, un benchmark phare de la navigation embarquée depuis plusieurs années. Il se positionne face à deux familles de méthodes concurrentes : celles qui exploitent des LLM sans entraînement supplémentaire pour raisonner sur la scène, coûteuses en inférence, et celles qui affinent des politiques par RL de bout en bout, limitées en généralisation hors distribution. En s'appuyant sur CLIP, déjà largement utilisé pour l'ancrage vision-langage, et sur un entraînement texte-seul transférable au moment du test, les auteurs proposent une voie plus économe en ressources. Publié en v2 sur arXiv, l'article reste à ce stade une contribution académique évaluée en simulation, sans annonce de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source
OVMAN : une tâche et un benchmark pour la navigation à vocabulaire ouvert sensible au mouvement
3arXiv cs.RO 

OVMAN : une tâche et un benchmark pour la navigation à vocabulaire ouvert sensible au mouvement

OVMAN est un nouveau benchmark de navigation robotique (arXiv:2609.06424v2) où un agent doit retrouver, lors d'une deuxième visite, un objet déplacé ou disparu depuis son premier passage, par exemple "va vers la chaise qui a été déplacée" ou "va là où se trouvait le vase". Le jeu de données compte 219 épisodes à deux visites, chacun certifié résoluble par un agent oracle en trois passages, répartis sur six relations de changement dont deux ciblent un emplacement désormais vide. Un navigateur d'objets en zero-shot n'atteint sa cible que dans 12,3% des épisodes, avec des scores quasi nuls sur ces emplacements vidés (0,026 et 0,050). Une carte open-vocabulary auto-actualisée fait grimper le taux de réussite global de 0,396 à 0,479 sans progresser sur ces cas précis, tandis qu'un agent de référence simple plafonne à 45,2% contre 99,5% pour un oracle incarné. Ces résultats montrent qu'actualiser une carte sémantique de l'environnement ne suffit pas à résoudre la navigation dans un monde qui change entre deux visites, une nuance pour les approches de cartographie continue mises en avant dans la recherche récente. La décomposition d'erreur des auteurs situe le vrai obstacle ailleurs que dans la perception : ni la reconnaissance du nom de l'objet ni le choix final de la réponse ne posent problème, c'est le maintien de l'identité d'une même instance d'un objet d'une visite à l'autre qui échoue. Pour un intégrateur en logistique ou à domicile, où les objets bougent entre deux passages d'un robot, cela déplace l'effort d'ingénierie vers la mémoire et la correspondance d'instances plutôt que vers la seule perception ou le mapping temps réel. OVMAN s'ajoute aux benchmarks de navigation vision-langage qui supposaient jusqu'ici une scène figée entre la formulation d'une instruction et son exécution, une hypothèse rarement vraie hors laboratoire. Les auteurs publient les 219 épisodes et leur protocole de certification par oracle pour que d'autres équipes puissent comparer leurs systèmes sur cette tâche précise. Aucun acteur commercial ni déploiement produit n'est associé à ce travail, qui reste une contribution académique destinée à orienter les futurs systèmes de navigation embarquée vers la gestion de la mémoire d'instance entre visites.

RecherchePaper
1 source
FUS3DMaps : cartographie sémantique à vocabulaire ouvert par fusion 3D de couches voxel et instance
4arXiv cs.RO 

FUS3DMaps : cartographie sémantique à vocabulaire ouvert par fusion 3D de couches voxel et instance

Une équipe de recherche a publié le 6 mai 2026 sur arXiv (référence 2605.03669) FUS3DMaps, une méthode de cartographie sémantique 3D à vocabulaire ouvert conçue pour permettre à des robots de localiser spatialement des concepts arbitraires sans ensemble de classes prédéfini. Le système fonctionne en ligne et maintient simultanément deux couches sémantiques dans une même carte de voxels partagée : une couche dense, qui projette directement les embeddings de pixels sur la carte 3D, et une couche instance-level, qui segmente les vues, encode les régions correspondant à des objets distincts, puis les associe en 3D. Les expériences menées sur des benchmarks établis de segmentation sémantique 3D montrent que FUS3DMaps atteint une précision compétitive à l'échelle de bâtiments multi-étages, un niveau de scalabilité rarement démontré pour ce type d'approche sans entraînement supervisé. Le code et les données complémentaires sont annoncés en accès ouvert. Ce qui distingue FUS3DMaps des méthodes existantes est la fusion sémantique inter-couches (cross-layer fusion), qui combine les forces complémentaires des deux représentations : la couche dense couvre l'intégralité du champ visuel sans nécessiter de segmentation préalable, mais souffre d'un manque de précision à l'échelle ; la couche instance-level est précise sur les objets individuels mais dépend de l'association 2D-3D. En fusionnant les embeddings des deux couches au niveau voxel, la méthode améliore la qualité de chacune. Pour garantir la scalabilité, la fusion dense et inter-couches est restreinte à une fenêtre spatiale glissante, évitant l'explosion mémoire dans les grands environnements. Pour les intégrateurs de robotique mobile ou les développeurs de systèmes de navigation en environnement ouvert, c'est une piste concrète vers des robots capables de répondre à des requêtes en langage naturel sur des espaces non balisés. La cartographie sémantique à vocabulaire ouvert est un champ en plein essor depuis l'émergence des vision-language models (VLM) comme CLIP. Les approches actuelles se divisent en deux familles : les méthodes instance-level (LSeg, OpenScene, EmbodiedScan) et les méthodes dense (ConceptFusion, OpenFusion), chacune avec ses compromis entre précision et scalabilité. FUS3DMaps tente de réconcilier les deux dans un pipeline unifié, sans fine-tuning. À noter que l'article est une prépublication arXiv, sans validation par les pairs à ce stade, et que les démonstrations vidéo et le code sont encore annoncés comme "à venir". Aucune entreprise industrielle ou partenaire de déploiement n'est mentionné : il s'agit d'une contribution de recherche académique, pas d'un produit commercialisé.

RechercheActu
1 source