
LifelongCrossNav : mémoire sémantique 3D persistante pour la navigation multi-objets entre étages
Le laboratoire de recherche associé au projet FlagEval de la Beijing Academy of Artificial Intelligence (BAAI) a publié le 10 août 2026 sur arXiv (référence 2608.07079v1) un article présentant LifelongCrossNav, un framework de navigation robotique pour la recherche séquentielle de plusieurs objets dans des bâtiments inconnus à plusieurs étages. Le système fait circuler l'agent à travers une série ordonnée de requêtes d'objets à localiser, tout en maintenant en continu une mémoire sémantique 3D partagée, construite sous forme de voxels épars. Cette mémoire accumule progressivement la structure géométrique du lieu, les zones franchissables et des caractéristiques vision-langage, ce qui permet de répondre à une nouvelle requête d'objet en réutilisant les informations déjà collectées, sans reconstruire la carte à chaque tâche. Pour gérer les changements d'étage, le framework ajoute une cartographie 3D consciente des surfaces porteuses, une perception dédiée aux escaliers et une politique de franchissement des marches sensible à la direction de déplacement. Les auteurs publient aussi HM3D-MFMON, un nouveau benchmark de navigation multi-étages et multi-objets construit sur les scènes du jeu de données Habitat-Matterport 3D (HM3D), avec un sous-ensemble où la séquence complète de tâches impose au moins un passage d'étage.
Ce travail s'attaque à un angle mort concret de la navigation robotique en intérieur: la plupart des systèmes traitent séparément la mémoire persistante multi-objets et la navigation inter-étages, alors que les deux problèmes se posent simultanément dans un bâtiment réel avec plusieurs pièces et niveaux. Les résultats rapportés montrent que LifelongCrossNav surpasse de façon constante une base de comparaison représentative reposant sur une carte sémantique persistante purement planaire, sur l'ensemble du benchmark HM3D-MFMON. L'article ne détaille toutefois pas de chiffres de taux de réussite précis dans son résumé, ce qui invite à la prudence avant de considérer le problème comme réglé à l'échelle d'un déploiement réel; il s'agit ici d'un résultat de recherche en simulation, pas d'un robot physique testé sur site.
Ce travail s'inscrit dans la lignée des recherches en ObjectNav et en cartographie sémantique pour la navigation embarquée, un champ nourri par des jeux de données comme HM3D et par la montée des architectures vision-langage-action appliquées à l'exploration. Il ne s'agit ni d'un produit commercialisé ni d'un pilote industriel, mais d'une publication scientifique accompagnée d'une page projet, sans annonce de partenariat, de licence ou d'intégration robotique concrète à ce stade.
Dans nos dossiers




