Aller au contenu principal
LifelongCrossNav : mémoire sémantique 3D persistante pour la navigation multi-objets entre étages
RecherchearXiv cs.RO 

LifelongCrossNav : mémoire sémantique 3D persistante pour la navigation multi-objets entre étages

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire de recherche associé au projet FlagEval de la Beijing Academy of Artificial Intelligence (BAAI) a publié le 10 août 2026 sur arXiv (référence 2608.07079v1) un article présentant LifelongCrossNav, un framework de navigation robotique pour la recherche séquentielle de plusieurs objets dans des bâtiments inconnus à plusieurs étages. Le système fait circuler l'agent à travers une série ordonnée de requêtes d'objets à localiser, tout en maintenant en continu une mémoire sémantique 3D partagée, construite sous forme de voxels épars. Cette mémoire accumule progressivement la structure géométrique du lieu, les zones franchissables et des caractéristiques vision-langage, ce qui permet de répondre à une nouvelle requête d'objet en réutilisant les informations déjà collectées, sans reconstruire la carte à chaque tâche. Pour gérer les changements d'étage, le framework ajoute une cartographie 3D consciente des surfaces porteuses, une perception dédiée aux escaliers et une politique de franchissement des marches sensible à la direction de déplacement. Les auteurs publient aussi HM3D-MFMON, un nouveau benchmark de navigation multi-étages et multi-objets construit sur les scènes du jeu de données Habitat-Matterport 3D (HM3D), avec un sous-ensemble où la séquence complète de tâches impose au moins un passage d'étage.

Ce travail s'attaque à un angle mort concret de la navigation robotique en intérieur: la plupart des systèmes traitent séparément la mémoire persistante multi-objets et la navigation inter-étages, alors que les deux problèmes se posent simultanément dans un bâtiment réel avec plusieurs pièces et niveaux. Les résultats rapportés montrent que LifelongCrossNav surpasse de façon constante une base de comparaison représentative reposant sur une carte sémantique persistante purement planaire, sur l'ensemble du benchmark HM3D-MFMON. L'article ne détaille toutefois pas de chiffres de taux de réussite précis dans son résumé, ce qui invite à la prudence avant de considérer le problème comme réglé à l'échelle d'un déploiement réel; il s'agit ici d'un résultat de recherche en simulation, pas d'un robot physique testé sur site.

Ce travail s'inscrit dans la lignée des recherches en ObjectNav et en cartographie sémantique pour la navigation embarquée, un champ nourri par des jeux de données comme HM3D et par la montée des architectures vision-langage-action appliquées à l'exploration. Il ne s'agit ni d'un produit commercialisé ni d'un pilote industriel, mais d'une publication scientifique accompagnée d'une page projet, sans annonce de partenariat, de licence ou d'intégration robotique concrète à ce stade.

À lire aussi

DM³-Nav : navigation sémantique décentralisée multi-agents, multimodale et multi-objets
1arXiv cs.RO 

DM³-Nav : navigation sémantique décentralisée multi-agents, multimodale et multi-objets

DM³-Nav (Decentralized Multi-Agent Multimodal Multi-Object Navigation) est un système de navigation sémantique multi-robots présenté dans un preprint arXiv déposé en avril 2026. L'architecture repose sur une décentralisation intégrale : aucun coordinateur central, aucune carte globale agrégée, aucun état partagé à l'exécution. Les robots se coordonnent exclusivement via une communication ad hoc par paires, en échangeant cartes locales, état des missions et intentions de navigation, sans synchronisation globale. Un mécanisme implicite d'allocation de tâches combine la diffusion d'intentions et une sélection de frontières pondérée par la distance pour réduire les explorations redondantes. Le système a été évalué sur les scènes HM3DSem via les benchmarks HM3Dv0.2 et GOAT-Bench, puis validé en environnement de bureau réel avec deux robots mobiles fonctionnant entièrement sur calcul et capteurs embarqués, sans infrastructure réseau centrale. Sur le plan des résultats, DM³-Nav égale ou dépasse les baselines centralisées et à carte partagée tout en supprimant le point de défaillance unique (SPOF) inhérent aux architectures à coordinateur. Pour un intégrateur de flotte AMR ou un opérateur industriel, l'implication concrète est directe : une panne réseau ou serveur ne paralyse plus la flotte entière. La spécification d'objectifs en vocabulaire ouvert et multimodale (texte et image sans réentraînement) élargit le périmètre des missions reconfigurables sans reprogrammation. La validation sur GOAT-Bench, conçu pour les missions multi-objets en intérieurs réalistes, renforce la crédibilité de l'approche au-delà du simulateur. La navigation sémantique multi-agents était jusqu'ici dominée par les approches centralisées à carte commune, portées par des travaux de CMU, Meta AI Research (Habitat-challenge) et Georgia Tech. DM³-Nav s'inscrit dans une tendance vers la décentralisation, dictée par les contraintes de passage à l'échelle en entrepôt, hôpital ou site industriel où la connectivité est intermittente. Il faut toutefois relativiser : le papier est un preprint non encore révisé par les pairs, et la validation terrain se limite à deux robots dans un seul bureau, écart significatif avec les 80 scènes simulées HM3DSem. Les suites probables passent par une soumission en conférence (IROS 2026 ou ICRA 2027) et une extension à des flottes plus importantes pour confirmer la tenue à l'échelle.

RecherchePaper
1 source
SSTG-Nav : graphes topologiques spatio-sémantiques ancrés en métrique pour la navigation d'objets réutilisable
2arXiv cs.RO 

SSTG-Nav : graphes topologiques spatio-sémantiques ancrés en métrique pour la navigation d'objets réutilisable

Une équipe de recherche présente SSTG-Nav, un système de mémoire spatiale et sémantique pour la navigation robotique vers des objets (ObjectNav), détaillé dans une publication arXiv du 4 août 2026 (référence 2608.00527v1). Contrairement aux approches classiques qui traitent chaque mission comme une exploration inédite, ce système construit un graphe topologique métrique-sémantique réutilisable après une seule phase de pré-exploration, permettant au robot de localiser directement un point d'arrêt atteignable plutôt que de ré-explorer l'espace à chaque requête. Sur 1 000 épisodes répartis dans 36 scènes du benchmark HM3D-v2, la topologie proposée atteint un plafond de succès géométrique de 99,4 %. En ne faisant varier que l'ancrage métrique, le taux de succès (SR) et le SPL progressent de 0,835/0,560 à 0,920/0,603 ; une fusion tenant compte de la source des indices sémantiques pousse ces scores à 0,926/0,586. Un mécanisme de récupération fondé sur les trois meilleures hypothèses fait grimper le taux de succès à 0,928, 0,965 puis 0,975 selon la tentative, avec un SPL@3 de 0,601. Les auteurs valident l'ensemble par une implémentation complète sur ROS2/Nav2, du requêtage jusqu'à l'exécution physique. Ces résultats s'attaquent à un angle mort classique de la navigation robotique : reconnaître visuellement un objet ne suffit pas à identifier un endroit où le robot peut effectivement s'arrêter, et une seule erreur de cartographie confiante peut faire échouer toute la mission. En basculant d'une exploration à usage unique vers une mémoire persistante, capable de conserver plusieurs points de repli distincts en cas d'échec, le travail répond au besoin des robots de service déployés durablement dans un même lieu, domicile, bureau ou site industriel, gagner en fiabilité avec l'expérience plutôt que repartir de zéro à chaque requête. C'est un signal utile pour les intégrateurs évaluant la maturité des piles de navigation sémantique au-delà des démonstrations de laboratoire : les gains proviennent explicitement de l'ancrage métrique et de la fusion multi-source, pas d'un simple effet d'échelle du modèle, ce que confirment les tests de contrôle sur le champ de vision, la densité de points et la robustesse aux corruptions de données. Le travail s'inscrit dans la lignée des benchmarks ObjectNav standards du secteur, notamment Habitat-Matterport 3D (HM3D), utilisés pour comparer les architectures de navigation sémantique en environnement simulé avant tout déploiement réel. La validation sur ROS2/Nav2, pile logicielle de référence en robotique mobile open source, distingue cette publication d'un simple exercice de simulation en démontrant un pipeline complet, de la requête utilisateur à l'exécution physique. Aucun partenariat industriel ni calendrier de déploiement commercial n'est mentionné ; il s'agit à ce stade d'une contribution académique publiée sur arXiv, sans revue par les pairs formalisée. La suite logique, non précisée par les auteurs, serait une évaluation en conditions réelles au-delà des simulations HM3D, là où les erreurs de perception et les changements d'environnement au fil du temps posent des défis que les benchmarks statiques ne capturent pas entièrement.

RecherchePaper
1 source
« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »
3arXiv cs.RO 

« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »

Une équipe de recherche (RCI Lab) publie un nouveau framework baptisé Instance-Enriched Semantic Maps pour la navigation par instructions en langage naturel (Visual Language Navigation, VLN), avec trois apports techniques. D'abord, une cartographie 2.5D au niveau instance construite à partir d'images couleur et de profondeur via segmentation panoptique en vocabulaire ouvert, qui préserve les distinctions verticales et capture les petits objets, tout en associant à chaque élément des attributs sémantiques et des descriptions en langage naturel enrichies du contexte de la pièce. Ensuite, un module de traitement des requêtes s'appuyant sur un LLM pour sélectionner la cible, en routant dynamiquement les requêtes vers des experts spécialisés par type et en fusionnant leurs scores pour une sélection d'objectif cohérente quel que soit le formulation de la requête. Enfin, une représentation sémantique nettement plus compacte, avec une réduction de stockage d'environ 96 % par rapport aux approches à scene-graph 3D, tout en conservant l'information spatiale nécessaire à la navigation. Sur le plan des résultats, la représentation 2.5D dépasse la référence 3D de plus de 27 % en AUC normalisée, et le système complet améliore la récupération d'objets de plus de 17 % et le taux de réussite de navigation de plus de 23 % par rapport à la baseline, sur des types de requêtes variés. Pour les robots mobiles autonomes (AMR) et les agents embarqués évoluant en intérieur, ces travaux ciblent un goulot d'étranglement connu des systèmes VLN actuels : la cartographie sémantique existante manque de granularité au niveau des instances individuelles et se montre fragile face à la diversité réelle des formulations utilisateur. En réduisant drastiquement le coût de stockage des cartes tout en gardant leur précision spatiale, l'approche répond à une contrainte concrète de déploiement embarqué, où la mémoire et le calcul restent limités. C'est un signal que la navigation par langage naturel progresse vers une robustesse compatible avec des usages industriels au-delà des démonstrations de laboratoire. Le travail s'inscrit dans la lignée des systèmes VLN combinant cartes spatiales sémantiques et raisonnement par LLM, une direction de recherche active depuis l'essor des modèles de segmentation en vocabulaire ouvert. Les auteurs comparent explicitement leur méthode à des approches de référence en scene-graph 3D, positionnant leur contribution comme une alternative plus légère et plus précise. Le code et les démonstrations sont disponibles sur la page du projet, mais aucun calendrier de déploiement sur robot physique n'est mentionné à ce stade.

RecherchePaper
1 source
ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages
4arXiv cs.RO 

ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages

Une équipe de recherche présente ZONDA, un nouveau framework de navigation robotique "zero-shot" vers un objet désigné (Object Goal Navigation), conçu pour fonctionner dans des environnements multi-étages et en présence de piétons en mouvement. Le système repose sur trois composants : une planification heuristique multi-étages qui exploite des cartes de différences de hauteur pour permettre à un robot de gravir des escaliers et de changer d'étage sans contrôleur spécifique à la plateforme ; une vérification multi-vues de la cible, qui croise des observations à différentes échelles avec un modèle vision-langage (VLM) pour réduire les faux positifs de détection ; et un module d'évitement dynamique des piétons, qui suit et anticipe leurs déplacements pour générer des trajectoires préventives. Le système a été testé sur un robot bipède TITA du fabricant chinois Direct Drive Tech, ainsi que sur des simulations extensives utilisant les jeux de données HM3D et MP3D, deux benchmarks de référence pour la navigation en environnement intérieur photoréaliste. Les auteurs annoncent des résultats "significativement améliorés" par rapport aux méthodes existantes, ainsi qu'une robustesse maintenue sur HM3D-DYNA, une variante dynamique du benchmark incluant des agents mobiles. Cette publication s'attaque à une limite concrète et rarement traitée des systèmes de navigation robotique actuels : la quasi-totalité des méthodes de pointe supposent un environnement statique et confiné à un seul étage, une hypothèse commode en laboratoire mais irréaliste pour un déploiement réel en entrepôt, hôpital ou bâtiment de bureaux à plusieurs niveaux. En combinant franchissement d'escaliers sans apprentissage spécifique au robot et anticipation des piétons, ZONDA vise directement l'écart entre démonstration en simulation et usage industriel, un problème central pour les intégrateurs qui cherchent à déployer des robots mobiles ou humanoïdes au-delà d'un seul plateau. À noter que l'abstract ne fournit pas de chiffres précis de performance (taux de succès, distance parcourue, temps de cycle) permettant de comparer objectivement l'ampleur du gain revendiqué face aux méthodes concurrentes, une réserve à garder en tête avant de considérer le résultat comme acquis. Le champ de l'Object Goal Navigation s'est largement construit sur des benchmarks comme HM3D et MP3D, où les méthodes récentes intègrent de plus en plus des modèles vision-langage pour améliorer la reconnaissance sémantique des cibles, dans la lignée de travaux comme les architectures VLA utilisées en manipulation robotique. Le choix du robot bipède TITA de Direct Drive Tech comme plateforme de test réel, plutôt qu'un robot à roues plus classique en recherche de navigation, souligne l'ambition de valider l'approche sur une morphologie capable physiquement de franchir des escaliers, condition nécessaire à toute navigation multi-étages. L'article, publié sur arXiv le 24 juillet 2026, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution académique, dont la prochaine étape logique serait une validation sur davantage de plateformes robotiques et dans des environnements réels plus variés que le cadre expérimental actuel.

RecherchePaper
1 source