NaviScale : générer des ensembles de données de cartes sémantiques à grande échelle pour la navigation d'objets
Des chercheurs publient sur arXiv NaviScale, un système génératif de données d'entraînement pour la navigation robotique orientée objet (ObjectNav), où un robot doit localiser un objet identifié seulement par sa catégorie. Plutôt que de reconstruire un environnement 3D complet pour chaque exemple, le framework compose des plans d'appartements réels avec des cartes sémantiques et d'obstacles extraites pièce par pièce des jeux MP3D et HM3DSem, en variant la structure des plans et les combinaisons de pièces. Un module de lancer de rayons, VisRC, convertit ces cartes en observations partielles réalistes selon le champ de vision, la portée des capteurs et les occlusions. Le jeu de données final compte 192 000 cartes générées à partir de 24 000 plans issus de 12 794 propriétés. Après 300 000 itérations, le prédicteur atteint 64,3% de réussite et 34,8% de SPL (succès pondéré par la longueur du trajet) sur HM3D, et 43,1% et 16,8% sur MP3D, avec un test sur robot physique.
Ce travail répond à un frein connu de la navigation incarnée: la collecte de données 3D annotées reste lente et coûteuse, ce qui limite la généralisation des modèles à des lieux inédits. En entraînant un prédicteur sur des cartes composées plutôt que reconstruites en 3D, NaviScale ouvre une voie pour multiplier le volume de données d'entraînement à moindre coût, intéressant pour les équipes de robotique mobile et les intégrateurs de robots de service ou d'AMR (robots mobiles autonomes). Les scores restent toutefois issus de benchmarks de simulation, et le test sur robot physique, peu détaillé dans le résumé, appelle à la prudence avant de conclure à un transfert simulation-réel abouti.
NaviScale s'inscrit dans la lignée des approches d'ObjectNav fondées sur des cartes sémantiques, alternative aux politiques de bout en bout entraînées par renforcement en environnement 3D complet, plus gourmandes en données et en calcul. En s'appuyant sur les jeux établis MP3D (Matterport3D) et HM3DSem, les auteurs cherchent à combler l'écart entre les besoins massifs des modèles de navigation actuels et la rareté des scènes 3D annotées publiques. Il s'agit d'une contribution de recherche, sans partenariat industriel ni calendrier commercial mentionné, complétée par des tests sur la robustesse aux erreurs de segmentation et une validation préliminaire sur robot physique.
Dans nos dossiers




