Aller au contenu principal
MASt3R-Nav : navigation WayPixel dans des cartes 3D relatives
RecherchearXiv cs.RO 

MASt3R-Nav : navigation WayPixel dans des cartes 3D relatives

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié fin mai 2026 sur arXiv (réf. 2605.24111) une nouvelle méthode de navigation visuelle pour robots, baptisée MASt3R-Nav. Le système repose sur une représentation de carte appelée "WayPixel Costmap", fondée sur le concept de connectivité pixel-relative. À partir d'une séquence d'images, le système établit des correspondances entre pixels dans les référentiels 3D propres à chaque paire d'images, sans exiger de cohérence géométrique globale à l'échelle de la carte complète. Ces liaisons inter-images forment un graphe dense, progressivement sparsifié pour permettre une planification de trajectoire globale. Un contrôleur est ensuite entraîné à prédire des séquences de déplacement à partir de ce costmap dense. La méthode a été validée sur quatre types de tâches de navigation en simulation, complétées par des démonstrations en environnement réel.

L'intérêt de l'approche tient à sa position charnière entre deux paradigmes établis. Les systèmes SLAM classiques (ORB-SLAM3, OpenVINS) offrent une géométrie précise mais imposent une cohérence globale coûteuse en calcul et sensible aux dérives. Les graphes topologiques à base d'images évitent ce problème, mais cantonnent la navigation au mode "enseigner puis répéter" (teach-and-repeat), incapable de s'adapter à des modifications d'environnement. MASt3R-Nav démontre que la connectivité pixel-relative constitue une variable de conditionnement statistiquement plus précise que ses équivalents image ou objet pour la prédiction de contrôle, ouvrant la voie à des robots mobiles autonomes (AMR) plus généralisables sans pipeline SLAM complet.

Le nom MASt3R fait référence au modèle de mise en correspondance 3D du même nom, présenté à CVPR 2024 par des équipes européennes dont l'INRIA, dont les capacités de matching géométrique dense servent de fondation à cette méthode. Dans le paysage concurrentiel, MASt3R-Nav se positionne face aux approches topologiques neuronales comme NetVLAD ou AnyLoc, et aux systèmes de navigation end-to-end récents tels que GNFactor. À noter qu'il s'agit à ce stade d'un preprint sans validation industrielle annoncée ; les métriques de performance restent issues d'environnements simulés et de démonstrations sélectionnées, sans benchmark standardisé public. Les prochaines étapes naturelles concernent l'évaluation sur des plateformes mobiles réelles en conditions non contrôlées.

Impact France/UE

La méthode s'appuie sur le modèle MASt3R développé notamment par l'INRIA (France), valorisant indirectement la recherche européenne en perception 3D pour la robotique mobile autonome.

Dans nos dossiers

À lire aussi

SemSafe-3DGS : navigation active tenant compte du risque sémantique dans des cartes 3D Gaussian Splatting incertaines
1arXiv cs.RO 

SemSafe-3DGS : navigation active tenant compte du risque sémantique dans des cartes 3D Gaussian Splatting incertaines

Une équipe de recherche publie sur arXiv (identifiant 2609.19330v1) un nouveau framework baptisé SemSafe-3DGS, destiné à la navigation active et sécurisée de robots autonomes dans des environnements partiellement observés. Le système s'appuie sur des cartes 3D construites par Gaussian Splatting, une technique de reconstruction de scène par primitives gaussiennes, auxquelles sont associés des attributs sémantiques. Chaque primitive gaussienne reçoit un poids de risque dépendant de sa classe sémantique, intégré dans un modèle de distance de collision basé sur l'Average Value-at-Risk. Ces distances pondérées alimentent une fonction de barrière de contrôle (control barrier function, CBF), combinée à une seconde barrière dite de perception active qui pousse le robot à recueillir des observations réduisant l'incertitude géométrique de la carte le long de sa trajectoire prévue. Les deux objectifs sont fusionnés dans un unique programme quadratique sous contrainte CBF-QP, qui impose l'évitement de collision comme contrainte dure tout en assouplissant l'acquisition d'information lorsqu'elle entre en conflit avec la sécurité. Les auteurs rapportent des expériences validant l'efficacité de la contrainte de sécurité, une navigation améliorée grâce à la perception active, une adaptation de trajectoire dépendante de la sémantique, ainsi qu'une exécution sur robot réel à dynamique de type Ackermann. L'intérêt pour l'industrie robotique tient au constat de départ : les formulations de sécurité existantes raisonnent presque exclusivement sur la géométrie, traitant de façon identique des obstacles géométriquement similaires mais sémantiquement très différents, par exemple un mur et une personne. En intégrant la sémantique directement dans la fonction de barrière plutôt qu'en aval, l'approche vise une prise de décision plus fine pour les robots mobiles opérant en environnement humain ou industriel partiellement cartographié, un enjeu direct pour les intégrateurs d'AMR et de plateformes de navigation autonome. Ce travail s'inscrit dans la lignée des méthodes de contrôle sûr par CBF-QP, désormais couplées aux représentations de scène par Gaussian Splatting qui gagnent du terrain face aux cartes d'occupation classiques pour leur richesse géométrique et photométrique. Il s'agit d'une publication de recherche en preprint, sans annonce de produit ni de partenariat industriel ; les prochaines étapes concerneraient une validation sur davantage de plateformes robotiques et de scénarios sémantiques.

RecherchePaper
1 source
Contrôle de sécurité : navigation vers vue optimale sans collision dans des cartes en Gaussian Splatting 3D
2arXiv cs.RO 

Contrôle de sécurité : navigation vers vue optimale sans collision dans des cartes en Gaussian Splatting 3D

Splat-CBF, une méthode de contrôle publiée sur arXiv (2609.23100, soumis en septembre 2026), s'attaque à un problème classique de la navigation robotique en environnement non cartographié : où regarder et comment se déplacer en même temps, sachant que les zones les plus intéressantes à observer sont aussi celles où le robot maîtrise le moins ses marges de sécurité. La méthode combine deux fonctions barrières de contrôle (control barrier functions, CBF) dans un seul programme quadratique. La première impose la sécurité comme contrainte dure, en convertissant l'Average Value-at-Risk du champ de gaussiennes 3D (Gaussian Splatting) de la carte en une contrainte lisse et unique. La seconde encourage, en contrainte souple, les orientations de caméra qui maximisent le gain d'information de Fisher attendu le long de la trajectoire planifiée, une approche dite de "next-best-view". Une pénalité de relâchement s'ajuste dynamiquement selon la fréquence à laquelle la contrainte de perception a déjà été assouplie et la proximité d'une zone incertaine. Les auteurs valident l'approche en simulation intérieure, sur un bras manipulateur Kinova dans Isaac Sim, et sur un robot mobile à direction Ackermann en conditions réelles. Les résultats indiquent une navigation plus rapide, une collecte d'informations accrue et un temps de calcul en ligne réduit par rapport à des approches de référence limitées soit à la sécurité seule, soit à la perception seule, le robot ne renonçant à un mouvement informatif que lorsque la sécurité l'exige. L'intérêt pour les intégrateurs et roboticiens tient à la démonstration qu'exploration active et garanties de sécurité formelles peuvent être unifiées dans une seule optimisation temps réel plutôt que traitées en pipelines séquentiels, un enjeu direct pour les AMR d'entrepôt, les robots d'inspection ou les manipulateurs opérant dans des environnements inconnus ou changeants où attendre une cartographie complète avant de bouger n'est pas viable. Le travail s'inscrit dans l'adoption croissante du Gaussian Splatting, initialement une technique de rendu graphique, comme représentation de carte différentiable et photoréaliste pour la robotique, en alternative aux nuages de points ou aux champs de radiance neuronaux, avec l'avantage de fournir des estimations d'incertitude exploitables analytiquement. Il s'agit d'une contribution de recherche, testée à petite échelle sur un seul bras et un seul robot roulant, sans annonce de déploiement industriel ni de partenaire commercial ; les suites logiques évoquées par les auteurs porteraient sur des environnements dynamiques plus complexes ou des scénarios multi-robots.

RecherchePaper
1 source
SignScene : ancrage visuel des panneaux pour la navigation sans carte
3arXiv cs.RO 

SignScene : ancrage visuel des panneaux pour la navigation sans carte

Des chercheurs ont publié SignScene (arXiv 2602.12686), un système permettant à un robot de naviguer sans carte préalable en interprétant les panneaux de signalisation présents dans l'environnement. Évalué sur un jeu de données de 114 requêtes couvrant neuf types d'environnements différents, le système atteint 88 % de précision dans ce qu'ils appellent le "sign grounding" : la capacité à associer les instructions sémantiques d'un panneau à des éléments de la scène 3D locale et à des actions de navigation concrètes. La démonstration a été réalisée sur un robot Boston Dynamics Spot naviguant en conditions réelles en s'appuyant uniquement sur les panneaux visibles, sans carte ni waypoints préprogrammés. Le défi central est la représentation spatiale : les grands modèles vision-langage (VLMs) disposent du raisonnement sémantique nécessaire pour interpréter un panneau ("Sortie à 50 m à droite"), mais ils sont sensibles à la manière dont l'information spatiale leur est présentée. SignScene introduit une représentation "sign-centric" qui extrait les éléments de scène pertinents pour la navigation et les organise autour du panneau détecté, améliorant significativement le raisonnement du VLM par rapport aux approches de référence, sans que les chiffres exacts de ces dernières soient publiés dans l'abstract disponible. Pour les intégrateurs industriels, l'enjeu est direct : un robot capable d'interpréter les panneaux existants d'un entrepôt ou d'un hôpital pourrait être déployé sans phase de cartographie SLAM préalable, réduisant les coûts et délais d'installation tout en fonctionnant dans des environnements qui évoluent. La navigation sans carte est un axe de recherche actif en robotique mobile, traditionnellement dominé par SLAM ou les cartes topologiques préprogrammées. L'essor des VLMs a ouvert la voie à une navigation guidée par le langage naturel, avec des travaux comme SayNav, VLMaps ou LM-Nav comme précédents directs. SignScene se positionne sur le créneau spécifique des panneaux physiques, signal abondant dans les environnements humains mais peu exploité en robotique autonome. Le robot Spot de Boston Dynamics sert ici de plateforme de validation standard dans la communauté académique. Les prochaines étapes logiques incluraient une extension aux environnements extérieurs urbains ou logistiques, et l'intégration dans des pipelines VLA (Vision-Language-Action) combinant interprétation de panneaux et planification de trajectoire bout-en-bout.

RecherchePaper
1 source
SoftNav : intégrer des tokens de scène 3D dans les VLM pour la navigation incarnée
4arXiv cs.RO 

SoftNav : intégrer des tokens de scène 3D dans les VLM pour la navigation incarnée

Des chercheurs ont publié SoftNav, une nouvelle méthode de navigation embarquée pour robots et agents autonomes, décrite dans un article arXiv (2607.14586v1) mis en ligne le 17 juillet 2026. Le système s'attaque à un problème concret : lorsqu'un agent doit localiser une cible dans un environnement inconnu, les approches actuelles transmettent l'information de la scène 3D aux modèles vision-langage (VLM) sous forme de texte, ce qui crée une perte d'information entre la représentation spatiale et le raisonnement du modèle. SoftNav injecte à la place un token par objet détecté ou par frontière d'exploration, directement dans l'espace caché du VLM, via un projecteur léger, sans texte intermédiaire. L'encodeur 3D et le VLM restent gelés durant l'entraînement, qui ne nécessite qu'environ 1 200 échantillons et 17 millions de paramètres entraînables, un volume très réduit pour ce type de tâche. Sur le benchmark HM3D-OVON, la méthode atteint des taux de réussite de 74,2 %, 68,3 % et 66,7 % selon les trois découpages testés, dépassant toutes les approches précédentes en taux de réussite comme en efficacité de trajectoire (SPL). L'intérêt principal tient à la généralisation sans réentraînement : la même politique de navigation, entraînée une fois, transfère en zero-shot vers GOAT-Bench (67,2 % de réussite), vers SG3D (47,2 % de sous-réussite) et vers un déploiement réel sur robot physique, sans modification d'architecture. Pour les intégrateurs et équipes de recherche en robotique, ce résultat appuie l'idée que le goulot d'étranglement des VLM appliqués à la navigation n'est pas tant la capacité de raisonnement du modèle que le format de transmission de l'information géométrique : une simple sérialisation textuelle du monde 3D dégrade les performances par rapport à une injection au niveau des embeddings. C'est un argument technique en faveur de représentations hybrides texte-plus-tokens continus dans les pipelines VLA (vision-language-action), plutôt que du tout-texte. L'étude s'inscrit dans la lignée des travaux récents combinant perception 3D et modèles de langage pour la navigation d'agents, un axe de recherche actif depuis l'essor des VLM généralistes appliqués à la robotique. Les auteurs comparent leur approche à plusieurs méthodes antérieures sur navigation orientée objectif, sans toutefois préciser de calendrier de déploiement industriel ni de partenariat commercial à ce stade : il s'agit pour l'instant d'un résultat de recherche validé sur benchmarks académiques et en test robot limité, pas d'un produit prêt à l'intégration.

RechercheActu
1 source