Aller au contenu principal
LifelongCrossNav : mémoire sémantique 3D persistante pour la navigation multi-objets entre étages
RecherchearXiv cs.RO 

LifelongCrossNav : mémoire sémantique 3D persistante pour la navigation multi-objets entre étages

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire de recherche associé au projet FlagEval de la Beijing Academy of Artificial Intelligence (BAAI) a publié le 10 août 2026 sur arXiv (référence 2608.07079v1) un article présentant LifelongCrossNav, un framework de navigation robotique pour la recherche séquentielle de plusieurs objets dans des bâtiments inconnus à plusieurs étages. Le système fait circuler l'agent à travers une série ordonnée de requêtes d'objets à localiser, tout en maintenant en continu une mémoire sémantique 3D partagée, construite sous forme de voxels épars. Cette mémoire accumule progressivement la structure géométrique du lieu, les zones franchissables et des caractéristiques vision-langage, ce qui permet de répondre à une nouvelle requête d'objet en réutilisant les informations déjà collectées, sans reconstruire la carte à chaque tâche. Pour gérer les changements d'étage, le framework ajoute une cartographie 3D consciente des surfaces porteuses, une perception dédiée aux escaliers et une politique de franchissement des marches sensible à la direction de déplacement. Les auteurs publient aussi HM3D-MFMON, un nouveau benchmark de navigation multi-étages et multi-objets construit sur les scènes du jeu de données Habitat-Matterport 3D (HM3D), avec un sous-ensemble où la séquence complète de tâches impose au moins un passage d'étage.

Ce travail s'attaque à un angle mort concret de la navigation robotique en intérieur: la plupart des systèmes traitent séparément la mémoire persistante multi-objets et la navigation inter-étages, alors que les deux problèmes se posent simultanément dans un bâtiment réel avec plusieurs pièces et niveaux. Les résultats rapportés montrent que LifelongCrossNav surpasse de façon constante une base de comparaison représentative reposant sur une carte sémantique persistante purement planaire, sur l'ensemble du benchmark HM3D-MFMON. L'article ne détaille toutefois pas de chiffres de taux de réussite précis dans son résumé, ce qui invite à la prudence avant de considérer le problème comme réglé à l'échelle d'un déploiement réel; il s'agit ici d'un résultat de recherche en simulation, pas d'un robot physique testé sur site.

Ce travail s'inscrit dans la lignée des recherches en ObjectNav et en cartographie sémantique pour la navigation embarquée, un champ nourri par des jeux de données comme HM3D et par la montée des architectures vision-langage-action appliquées à l'exploration. Il ne s'agit ni d'un produit commercialisé ni d'un pilote industriel, mais d'une publication scientifique accompagnée d'une page projet, sans annonce de partenariat, de licence ou d'intégration robotique concrète à ce stade.

À lire aussi

DM³-Nav : navigation sémantique décentralisée multi-agents, multimodale et multi-objets
1arXiv cs.RO 

DM³-Nav : navigation sémantique décentralisée multi-agents, multimodale et multi-objets

DM³-Nav (Decentralized Multi-Agent Multimodal Multi-Object Navigation) est un système de navigation sémantique multi-robots présenté dans un preprint arXiv déposé en avril 2026. L'architecture repose sur une décentralisation intégrale : aucun coordinateur central, aucune carte globale agrégée, aucun état partagé à l'exécution. Les robots se coordonnent exclusivement via une communication ad hoc par paires, en échangeant cartes locales, état des missions et intentions de navigation, sans synchronisation globale. Un mécanisme implicite d'allocation de tâches combine la diffusion d'intentions et une sélection de frontières pondérée par la distance pour réduire les explorations redondantes. Le système a été évalué sur les scènes HM3DSem via les benchmarks HM3Dv0.2 et GOAT-Bench, puis validé en environnement de bureau réel avec deux robots mobiles fonctionnant entièrement sur calcul et capteurs embarqués, sans infrastructure réseau centrale. Sur le plan des résultats, DM³-Nav égale ou dépasse les baselines centralisées et à carte partagée tout en supprimant le point de défaillance unique (SPOF) inhérent aux architectures à coordinateur. Pour un intégrateur de flotte AMR ou un opérateur industriel, l'implication concrète est directe : une panne réseau ou serveur ne paralyse plus la flotte entière. La spécification d'objectifs en vocabulaire ouvert et multimodale (texte et image sans réentraînement) élargit le périmètre des missions reconfigurables sans reprogrammation. La validation sur GOAT-Bench, conçu pour les missions multi-objets en intérieurs réalistes, renforce la crédibilité de l'approche au-delà du simulateur. La navigation sémantique multi-agents était jusqu'ici dominée par les approches centralisées à carte commune, portées par des travaux de CMU, Meta AI Research (Habitat-challenge) et Georgia Tech. DM³-Nav s'inscrit dans une tendance vers la décentralisation, dictée par les contraintes de passage à l'échelle en entrepôt, hôpital ou site industriel où la connectivité est intermittente. Il faut toutefois relativiser : le papier est un preprint non encore révisé par les pairs, et la validation terrain se limite à deux robots dans un seul bureau, écart significatif avec les 80 scènes simulées HM3DSem. Les suites probables passent par une soumission en conférence (IROS 2026 ou ICRA 2027) et une extension à des flottes plus importantes pour confirmer la tenue à l'échelle.

RecherchePaper
1 source
SSTG-Nav : graphes topologiques spatio-sémantiques ancrés en métrique pour la navigation d'objets réutilisable
2arXiv cs.RO 

SSTG-Nav : graphes topologiques spatio-sémantiques ancrés en métrique pour la navigation d'objets réutilisable

Une équipe de recherche présente SSTG-Nav, un système de mémoire spatiale et sémantique pour la navigation robotique vers des objets (ObjectNav), détaillé dans une publication arXiv du 4 août 2026 (référence 2608.00527v1). Contrairement aux approches classiques qui traitent chaque mission comme une exploration inédite, ce système construit un graphe topologique métrique-sémantique réutilisable après une seule phase de pré-exploration, permettant au robot de localiser directement un point d'arrêt atteignable plutôt que de ré-explorer l'espace à chaque requête. Sur 1 000 épisodes répartis dans 36 scènes du benchmark HM3D-v2, la topologie proposée atteint un plafond de succès géométrique de 99,4 %. En ne faisant varier que l'ancrage métrique, le taux de succès (SR) et le SPL progressent de 0,835/0,560 à 0,920/0,603 ; une fusion tenant compte de la source des indices sémantiques pousse ces scores à 0,926/0,586. Un mécanisme de récupération fondé sur les trois meilleures hypothèses fait grimper le taux de succès à 0,928, 0,965 puis 0,975 selon la tentative, avec un SPL@3 de 0,601. Les auteurs valident l'ensemble par une implémentation complète sur ROS2/Nav2, du requêtage jusqu'à l'exécution physique. Ces résultats s'attaquent à un angle mort classique de la navigation robotique : reconnaître visuellement un objet ne suffit pas à identifier un endroit où le robot peut effectivement s'arrêter, et une seule erreur de cartographie confiante peut faire échouer toute la mission. En basculant d'une exploration à usage unique vers une mémoire persistante, capable de conserver plusieurs points de repli distincts en cas d'échec, le travail répond au besoin des robots de service déployés durablement dans un même lieu, domicile, bureau ou site industriel, gagner en fiabilité avec l'expérience plutôt que repartir de zéro à chaque requête. C'est un signal utile pour les intégrateurs évaluant la maturité des piles de navigation sémantique au-delà des démonstrations de laboratoire : les gains proviennent explicitement de l'ancrage métrique et de la fusion multi-source, pas d'un simple effet d'échelle du modèle, ce que confirment les tests de contrôle sur le champ de vision, la densité de points et la robustesse aux corruptions de données. Le travail s'inscrit dans la lignée des benchmarks ObjectNav standards du secteur, notamment Habitat-Matterport 3D (HM3D), utilisés pour comparer les architectures de navigation sémantique en environnement simulé avant tout déploiement réel. La validation sur ROS2/Nav2, pile logicielle de référence en robotique mobile open source, distingue cette publication d'un simple exercice de simulation en démontrant un pipeline complet, de la requête utilisateur à l'exécution physique. Aucun partenariat industriel ni calendrier de déploiement commercial n'est mentionné ; il s'agit à ce stade d'une contribution académique publiée sur arXiv, sans revue par les pairs formalisée. La suite logique, non précisée par les auteurs, serait une évaluation en conditions réelles au-delà des simulations HM3D, là où les erreurs de perception et les changements d'environnement au fil du temps posent des défis que les benchmarks statiques ne capturent pas entièrement.

RecherchePaper
1 source
CGFM-Nav : mémoire cognitive de graphe-champ pour la navigation incarnée multimodale et continue guidée sémantiquement
3arXiv cs.RO 

CGFM-Nav : mémoire cognitive de graphe-champ pour la navigation incarnée multimodale et continue guidée sémantiquement

Des chercheurs présentent CGFM-Nav, un framework de navigation robotique fondé sur un nouveau schéma de représentation d'environnement baptisé Cognitive Graph-Field Memory (CGFM), détaillé dans un article publié sur arXiv (référence 2608.29114v1) le 29 août 2026. CGFM combine une mémoire relationnelle explicite, sous forme de graphe de scène multimodal organisant objets, relations spatiales et observations visuelles, avec un champ sémantique continu qui guide l'exploration lorsqu'aucune correspondance fiable n'est trouvée dans le graphe. Le système repose sur un modèle vision-langage Qwen3-VL-8B comme backbone, complété par une sélection de sous-graphes pertinents pour la tâche, un raisonnement VLM et une boucle de vérification par feedback. Sur le benchmark GOAT-Bench, les auteurs rapportent une hausse du taux de succès global de 53,2% à 63,0%, et du score SPL (Success weighted by Path Length) de 30,0% à 39,6%, par rapport à une base équivalente sans CGFM. Ces chiffres sont qualifiés d'expérience préliminaire par les auteurs eux-mêmes, ce qui invite à la prudence avant toute généralisation. Pour l'industrie de la navigation robotique et de l'IA incarnée, ce travail s'attaque à un problème concret : les agents de navigation vision-langage (VLN) peinent historiquement à combiner mémoire sémantique persistante et exploration continue de zones inconnues, deux capacités habituellement traitées séparément. En prouvant qu'un même backbone VLM voit ses performances progresser significativement grâce à une meilleure structuration de la mémoire spatiale, l'étude appuie l'idée que les gains en navigation autonome ne viennent pas seulement de modèles plus gros, mais aussi de représentations d'environnement mieux conçues, un argument pertinent pour les intégrateurs travaillant sur des robots mobiles ou humanoïdes devant opérer en continu dans des environnements changeants. Ce travail s'inscrit dans la lignée des recherches en VLN qui cherchent à dépasser les limites des scene graphs statiques classiques, insuffisants pour guider l'exploration en l'absence de cible identifiée. Il se positionne dans un paysage où d'autres approches combinent déjà mémoire de graphe et modèles de fondation pour la navigation à long terme. L'article ne mentionne ni déploiement matériel, ni partenariat industriel, ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche évaluée en simulation sur GOAT-Bench, sans validation en conditions réelles.

RecherchePaper
1 source
NaviScale : générer des ensembles de données de cartes sémantiques à grande échelle pour la navigation d'objets
4arXiv cs.RO 

NaviScale : générer des ensembles de données de cartes sémantiques à grande échelle pour la navigation d'objets

Des chercheurs publient sur arXiv NaviScale, un système génératif de données d'entraînement pour la navigation robotique orientée objet (ObjectNav), où un robot doit localiser un objet identifié seulement par sa catégorie. Plutôt que de reconstruire un environnement 3D complet pour chaque exemple, le framework compose des plans d'appartements réels avec des cartes sémantiques et d'obstacles extraites pièce par pièce des jeux MP3D et HM3DSem, en variant la structure des plans et les combinaisons de pièces. Un module de lancer de rayons, VisRC, convertit ces cartes en observations partielles réalistes selon le champ de vision, la portée des capteurs et les occlusions. Le jeu de données final compte 192 000 cartes générées à partir de 24 000 plans issus de 12 794 propriétés. Après 300 000 itérations, le prédicteur atteint 64,3% de réussite et 34,8% de SPL (succès pondéré par la longueur du trajet) sur HM3D, et 43,1% et 16,8% sur MP3D, avec un test sur robot physique. Ce travail répond à un frein connu de la navigation incarnée: la collecte de données 3D annotées reste lente et coûteuse, ce qui limite la généralisation des modèles à des lieux inédits. En entraînant un prédicteur sur des cartes composées plutôt que reconstruites en 3D, NaviScale ouvre une voie pour multiplier le volume de données d'entraînement à moindre coût, intéressant pour les équipes de robotique mobile et les intégrateurs de robots de service ou d'AMR (robots mobiles autonomes). Les scores restent toutefois issus de benchmarks de simulation, et le test sur robot physique, peu détaillé dans le résumé, appelle à la prudence avant de conclure à un transfert simulation-réel abouti. NaviScale s'inscrit dans la lignée des approches d'ObjectNav fondées sur des cartes sémantiques, alternative aux politiques de bout en bout entraînées par renforcement en environnement 3D complet, plus gourmandes en données et en calcul. En s'appuyant sur les jeux établis MP3D (Matterport3D) et HM3DSem, les auteurs cherchent à combler l'écart entre les besoins massifs des modèles de navigation actuels et la rareté des scènes 3D annotées publiques. Il s'agit d'une contribution de recherche, sans partenariat industriel ni calendrier commercial mentionné, complétée par des tests sur la robustesse aux erreurs de segmentation et une validation préliminaire sur robot physique.

RecherchePaper
1 source