Aller au contenu principal
RecherchearXiv cs.RO 

NaviScale : générer des ensembles de données de cartes sémantiques à grande échelle pour la navigation d'objets

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv NaviScale, un système génératif de données d'entraînement pour la navigation robotique orientée objet (ObjectNav), où un robot doit localiser un objet identifié seulement par sa catégorie. Plutôt que de reconstruire un environnement 3D complet pour chaque exemple, le framework compose des plans d'appartements réels avec des cartes sémantiques et d'obstacles extraites pièce par pièce des jeux MP3D et HM3DSem, en variant la structure des plans et les combinaisons de pièces. Un module de lancer de rayons, VisRC, convertit ces cartes en observations partielles réalistes selon le champ de vision, la portée des capteurs et les occlusions. Le jeu de données final compte 192 000 cartes générées à partir de 24 000 plans issus de 12 794 propriétés. Après 300 000 itérations, le prédicteur atteint 64,3% de réussite et 34,8% de SPL (succès pondéré par la longueur du trajet) sur HM3D, et 43,1% et 16,8% sur MP3D, avec un test sur robot physique.

Ce travail répond à un frein connu de la navigation incarnée: la collecte de données 3D annotées reste lente et coûteuse, ce qui limite la généralisation des modèles à des lieux inédits. En entraînant un prédicteur sur des cartes composées plutôt que reconstruites en 3D, NaviScale ouvre une voie pour multiplier le volume de données d'entraînement à moindre coût, intéressant pour les équipes de robotique mobile et les intégrateurs de robots de service ou d'AMR (robots mobiles autonomes). Les scores restent toutefois issus de benchmarks de simulation, et le test sur robot physique, peu détaillé dans le résumé, appelle à la prudence avant de conclure à un transfert simulation-réel abouti.

NaviScale s'inscrit dans la lignée des approches d'ObjectNav fondées sur des cartes sémantiques, alternative aux politiques de bout en bout entraînées par renforcement en environnement 3D complet, plus gourmandes en données et en calcul. En s'appuyant sur les jeux établis MP3D (Matterport3D) et HM3DSem, les auteurs cherchent à combler l'écart entre les besoins massifs des modèles de navigation actuels et la rareté des scènes 3D annotées publiques. Il s'agit d'une contribution de recherche, sans partenariat industriel ni calendrier commercial mentionné, complétée par des tests sur la robustesse aux erreurs de segmentation et une validation préliminaire sur robot physique.

Dans nos dossiers

À lire aussi

SSTG-Nav : graphes topologiques spatio-sémantiques ancrés en métrique pour la navigation d'objets réutilisable
1arXiv cs.RO 

SSTG-Nav : graphes topologiques spatio-sémantiques ancrés en métrique pour la navigation d'objets réutilisable

Une équipe de recherche présente SSTG-Nav, un système de mémoire spatiale et sémantique pour la navigation robotique vers des objets (ObjectNav), détaillé dans une publication arXiv du 4 août 2026 (référence 2608.00527v1). Contrairement aux approches classiques qui traitent chaque mission comme une exploration inédite, ce système construit un graphe topologique métrique-sémantique réutilisable après une seule phase de pré-exploration, permettant au robot de localiser directement un point d'arrêt atteignable plutôt que de ré-explorer l'espace à chaque requête. Sur 1 000 épisodes répartis dans 36 scènes du benchmark HM3D-v2, la topologie proposée atteint un plafond de succès géométrique de 99,4 %. En ne faisant varier que l'ancrage métrique, le taux de succès (SR) et le SPL progressent de 0,835/0,560 à 0,920/0,603 ; une fusion tenant compte de la source des indices sémantiques pousse ces scores à 0,926/0,586. Un mécanisme de récupération fondé sur les trois meilleures hypothèses fait grimper le taux de succès à 0,928, 0,965 puis 0,975 selon la tentative, avec un SPL@3 de 0,601. Les auteurs valident l'ensemble par une implémentation complète sur ROS2/Nav2, du requêtage jusqu'à l'exécution physique. Ces résultats s'attaquent à un angle mort classique de la navigation robotique : reconnaître visuellement un objet ne suffit pas à identifier un endroit où le robot peut effectivement s'arrêter, et une seule erreur de cartographie confiante peut faire échouer toute la mission. En basculant d'une exploration à usage unique vers une mémoire persistante, capable de conserver plusieurs points de repli distincts en cas d'échec, le travail répond au besoin des robots de service déployés durablement dans un même lieu, domicile, bureau ou site industriel, gagner en fiabilité avec l'expérience plutôt que repartir de zéro à chaque requête. C'est un signal utile pour les intégrateurs évaluant la maturité des piles de navigation sémantique au-delà des démonstrations de laboratoire : les gains proviennent explicitement de l'ancrage métrique et de la fusion multi-source, pas d'un simple effet d'échelle du modèle, ce que confirment les tests de contrôle sur le champ de vision, la densité de points et la robustesse aux corruptions de données. Le travail s'inscrit dans la lignée des benchmarks ObjectNav standards du secteur, notamment Habitat-Matterport 3D (HM3D), utilisés pour comparer les architectures de navigation sémantique en environnement simulé avant tout déploiement réel. La validation sur ROS2/Nav2, pile logicielle de référence en robotique mobile open source, distingue cette publication d'un simple exercice de simulation en démontrant un pipeline complet, de la requête utilisateur à l'exécution physique. Aucun partenariat industriel ni calendrier de déploiement commercial n'est mentionné ; il s'agit à ce stade d'une contribution académique publiée sur arXiv, sans revue par les pairs formalisée. La suite logique, non précisée par les auteurs, serait une évaluation en conditions réelles au-delà des simulations HM3D, là où les erreurs de perception et les changements d'environnement au fil du temps posent des défis que les benchmarks statiques ne capturent pas entièrement.

RecherchePaper
1 source
Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense
2arXiv cs.RO 

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense

Des chercheurs ont publié une nouvelle version (v2) de l'article arXiv 2407.09016, qui présente OVExp, un framework d'exploration en vocabulaire ouvert pour la navigation robotique vers des objets-cibles non catégorisés au préalable. Le système s'appuie sur des modèles Dense CLIP pour généraliser la cartographie sémantique, sans recourir à l'inférence coûteuse de grands modèles de langage (LLM) ni à un entraînement intensif par apprentissage par renforcement (RL) de bout en bout. L'innovation centrale est une stratégie de transfert cross-modal sur cartographie sémantique : le réseau apprend d'abord uniquement à partir de texte, puis transfère ces représentations, au moment du test, vers une cartographie multimodale combinant localisation spatiale précise des objets et représentations visuelles généralisables. Les auteurs annoncent une généralisation robuste vers des objets-cibles inédits, validée sur les benchmarks établis d'ObjectNav, malgré un entraînement reposant sur des mises en page textuelles limitées en nombre d'objets. Pour l'industrie robotique et les intégrateurs, ce travail cible un problème concret de coût et de latence : les approches actuelles de navigation en vocabulaire ouvert, qui appellent un LLM à chaque décision ou nécessitent des heures d'entraînement RL par environnement, restent difficiles à déployer à grande échelle sur des robots mobiles autonomes (AMR) ou des plateformes d'inspection. En montrant qu'un réseau de prédiction d'objectifs basé sur une carte sémantique peut généraliser sans réentraînement lourd ni appel LLM en boucle, OVExp propose une alternative aux architectures VLA gourmandes en ressources, ce qui intéresse directement tout acteur cherchant à doter des robots de capacités de recherche d'objets flexibles sans exploser les coûts d'inférence en production. Ce travail s'inscrit dans la lignée des recherches sur ObjectNav, la tâche de navigation vers un objet-cible désigné par catégorie ou par image dans un environnement inconnu, un benchmark phare de la navigation embarquée depuis plusieurs années. Il se positionne face à deux familles de méthodes concurrentes : celles qui exploitent des LLM sans entraînement supplémentaire pour raisonner sur la scène, coûteuses en inférence, et celles qui affinent des politiques par RL de bout en bout, limitées en généralisation hors distribution. En s'appuyant sur CLIP, déjà largement utilisé pour l'ancrage vision-langage, et sur un entraînement texte-seul transférable au moment du test, les auteurs proposent une voie plus économe en ressources. Publié en v2 sur arXiv, l'article reste à ce stade une contribution académique évaluée en simulation, sans annonce de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source
I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs
3arXiv cs.RO 

I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs

Chercheurs de l'université de Wuhan (laboratoire i2Nav) ont publié i2Nav-Robot, un jeu de données à grande échelle destiné à la navigation par fusion multi-capteurs pour véhicules terrestres autonomes (UGV), en environnements intérieurs et extérieurs. La plateforme, un véhicule à roues omnidirectionnel, embarque des LiDAR solid-state à vision frontale et à 360 degrés de dernière génération, un radar millimétrique 4D, des caméras stéréo, une centrale inertielle (IMU), un récepteur GNSS et des odomètres à roues, tous synchronisés temporellement via une combinaison de synchronisation matérielle en ligne et de calibration hors ligne. Le jeu de données comprend dix séquences couvrant des scénarios variés (rues extérieures, parkings intérieurs) pour une distance cumulée d'environ 17 060 mètres, avec une vérité terrain de précision centimétrique obtenue par post-traitement de navigation intégrée sur IMU haut de gamme. Quinze méthodes open source de fusion multi-capteurs ont servi à valider la qualité des données. Le tout est accessible sur GitHub (i2Nav-WHU/i2Nav-Robot). Pour la recherche en navigation robotique, ce type de benchmark comble un manque réel: les jeux de données existants pour UGV souffrent souvent de configurations de capteurs limitées, d'une synchronisation imprécise, d'une vérité terrain incomplète ou peu fiable, et d'un manque de diversité de scénarios, ce qui freine le développement et la comparaison rigoureuse des algorithmes SLAM et de fusion de capteurs. Un dataset combinant LiDAR récents, radar 4D et vérité terrain centimétrique dans des environnements mixtes intérieur-extérieur offre aux équipes de recherche et aux intégrateurs un terrain d'évaluation plus représentatif des conditions réelles de déploiement, notamment pour les robots mobiles industriels et logistiques. Ce travail s'inscrit dans la lignée de benchmarks antérieurs comme KITTI ou M2DGR, mais cherche à dépasser leurs limites en matière de synchronisation et de diversité de capteurs, notamment via l'intégration récente du radar millimétrique 4D, technologie de plus en plus utilisée en complément du LiDAR pour la robustesse par mauvaise visibilité. La publication en open source, avec documentation complète sur GitHub, vise à en faire une référence pour les futures évaluations comparatives de méthodes de navigation autonome, un domaine où la disponibilité de données de qualité reste un goulot d'étranglement majeur pour l'industrie.

RecherchePaper
1 source
MotionForge : pipeline de génération de données et benchmark à grande échelle pour la manipulation longue portée d'objets dynamiques avec décalages de domaine
4arXiv cs.RO 

MotionForge : pipeline de génération de données et benchmark à grande échelle pour la manipulation longue portée d'objets dynamiques avec décalages de domaine

La communauté de recherche en robotique dispose depuis fin septembre 2026 d'un nouveau benchmark baptisé MotionForge, décrit dans un article arXiv (2609.25689) comme le premier à évaluer conjointement les changements de domaine et les interactions de longue durée dans la manipulation d'objets dynamiques. Le système combine un pipeline de génération de données et une suite de simulation couvrant 40 tâches d'interaction dynamique réparties en 11 patterns de mouvement distincts, dont 17 tâches dites longue durée (long-horizon). Deux protocoles structurent l'évaluation : le premier mesure la robustesse des politiques face à des changements de domaine isolés (par exemple uniquement l'arrière-plan) ou combinés (objets, arrière-plans, éclairage et vitesse modifiés simultanément) ; le second est un protocole d'exécution découplé et sensible à la latence, où l'environnement continue d'évoluer indépendamment du temps de calcul nécessaire à la politique pour décider de son action, contrairement aux simulateurs classiques qui figent la scène pendant l'inférence. Ce travail est important parce qu'il expose un décalage jusqu'ici mal quantifié entre les promesses des politiques robotiques généralistes de type vision-langage-action et leurs performances réelles hors environnements statiques ou quasi statiques. Les auteurs rapportent des limitations substantielles de ces politiques dès lors que plusieurs facteurs de domaine varient en même temps, ce qui contredit l'idée reçue selon laquelle le sim-to-real ou la généralisation à grande échelle seraient déjà largement résolus pour la manipulation dynamique. Pour les intégrateurs et décideurs industriels envisageant des déploiements en entrepôt, logistique ou chaîne de production où les objets bougent en continu, ce résultat invite à traiter les métriques de démonstration avec prudence tant que les tests ne reproduisent pas des conditions de domain shift joint et de latence réaliste. MotionForge répond à une lacune identifiée dans les benchmarks dynamiques existants, jugés trop centrés sur des interactions courtes et réactives avec des mouvements simples, sans protocole systématique de test sous changement de domaine ni exécution temps réel agnostique au modèle. En le positionnant comme testbed de référence, les auteurs visent à orienter les prochains travaux de recherche en IA incarnée vers des évaluations plus proches des conditions réelles, sans toutefois annoncer à ce stade de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source