Aller au contenu principal
ProteusVPR : reconnaissance visuelle de lieux multi-scènes pour la perception maritime et l'inspection de cabines
RecherchearXiv cs.RO 

ProteusVPR : reconnaissance visuelle de lieux multi-scènes pour la perception maritime et l'inspection de cabines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont déposé le 24 juin 2026 sur arXiv (2606.24234) ProteusVPR, un système de reconnaissance visuelle de lieu (VPR, Visual Place Recognition) conçu pour les robots d'inspection en milieu maritime. Le problème de fond : à bord d'un navire, un robot doit naviguer entre deux environnements visuellement antagonistes, les ponts extérieurs aux textures rares et aux variations d'éclairage sévères, et les cabines intérieures aux structures répétitives générant de fortes ambiguïtés. ProteusVPR répond avec une architecture à deux étapes : une première phase de récupération d'images via n'importe quel backbone VPR standard, suivie d'un réseau d'estimation géométrico-visuelle qui fusionne l'image récupérée avec deux trames temporellement précédentes, intégrant des descripteurs géométriques, un système de coordonnées affines locales et un encodage de l'azimut caméra. Les auteurs introduisent également le dataset XHZ, jeu de données panoramiques 8K collecté sur un navire en opération, couvrant des structures multi-niveaux de cabines, des zones de transition pont-intérieur et une séparation stricte requête-base de données. Sur ce benchmark, ProteusVPR réduit l'erreur de localisation moyenne de plus de 60 % par rapport aux backbones classiques testés.

Ce résultat pèse parce que les méthodes VPR actuelles, conçues pour l'urbain ou l'indoor, échouent systématiquement à généraliser sur des scènes aussi hétérogènes au sein d'un même parcours. En inspection navale autonome, une localisation dégradée invalide un cycle d'audit entier ou génère de fausses alertes sur l'état de la coque ou des espaces confinés. La modularité de ProteusVPR est son argument commercial le plus fort : son deuxième étage s'intègre au-dessus de tout pipeline VPR existant, ce qui réduit le coût d'adoption pour les équipes qui disposent déjà d'une infrastructure de localisation visuelle.

La VPR est un problème actif depuis vingt ans, de NetVLAD aux approches transformers récentes, mais son application maritime reste marginale, la plupart des systèmes embarqués s'appuyant sur LiDAR ou GNSS, peu fiables sous pont. Des acteurs comme SeaRobotics, Voyis ou Greensea Systems couvrent l'inspection de coque et sous-marine, mais le créneau ponts-cabines demeure peu industrialisé. L'équipe ne mentionne ni partenaire industriel ni calendrier de déploiement : ProteusVPR reste pour l'heure une contribution académique (preprint arXiv), sans produit embarqué démontré en conditions réelles.

Dans nos dossiers

À lire aussi

MAG-VLAQ : agrégation multimodale aérien-sol pour la reconnaissance de lieux en vue croisée
1arXiv cs.RO 

MAG-VLAQ : agrégation multimodale aérien-sol pour la reconnaissance de lieux en vue croisée

Des chercheurs ont publié MAG-VLAQ (Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition), un framework de reconnaissance de lieux qui associe des observations au sol -- caméra RGB et LiDAR -- à des images aériennes ou satellites. L'architecture repose sur des modèles de fondation pré-entraînés pour extraire des tokens visuels denses depuis les images sol et aériennes, auxquels s'ajoutent des tokens géométriques issus du LiDAR. La contribution principale est l'ODE-conditioned VLAQ : une fusion RGB-LiDAR pilotée par des équations différentielles ordinaires (ODE), couplée à des vecteurs de requêtes localement agrégées (VLAQ) dont les centres s'adaptent dynamiquement à l'état multi-modal fusionné. Sur le benchmark KITTI360-AG, MAG-VLAQ atteint 61,1 de Recall@1 en configuration satellite, contre 34,5 pour l'approche concurrente la plus proche, soit un quasi-doublement de l'état de l'art. Les résultats sont également validés sur nuScenes-AG. Le papier est disponible en préprint sur arXiv (2605.09418v1) et n'a pas encore été soumis à revue par les pairs. Ce gain de performance est significatif pour la localisation robotique en milieu urbain, où la capacité à se positionner sur une carte satellite sans GPS fiable reste un verrou applicatif majeur pour les véhicules autonomes, les drones de livraison ou les AMR opérant en extérieur. Cela dit, les benchmarks KITTI360-AG et nuScenes-AG sont dérivés de datasets de conduite autonome : leur transférabilité à des environnements industriels ou à des configurations de drones réels n'est pas démontrée. Sur le plan technique, le conditionnement ODE pour piloter dynamiquement les prototypes de requêtes représente une approche originale pour fusionner des modalités hétérogènes dans un descripteur global cohérent. C'est un signal que les modèles de fondation commencent à apporter des gains mesurables sur des tâches de localisation géométrique, au-delà de la détection d'objets. La reconnaissance de lieux multi-modale est un champ actif depuis une décennie, avec des approches pionnières comme NetVLAD (2016) pour la compression de descripteurs visuels. L'essor des modèles de fondation visuels -- DINOv2, SAM -- a relancé les performances sur cette tâche depuis 2023. Dans le paysage concurrent, des travaux comme AnyLoc, EigenPlaces ou BEV-Net cherchent également à combler l'écart entre vue sol et vue aérienne, mais restent majoritairement mono-modaux (vision seule). MAG-VLAQ se distingue en intégrant LiDAR et conditionnement ODE là où ces approches s'appuient uniquement sur le RGB. Aucun partenariat industriel ni timeline de déploiement n'est mentionné dans l'article : à ce stade, il s'agit d'une contribution académique dont les suites pratiques dépendront de tests sur des capteurs et scénarios réels.

RecherchePaper
1 source
Moteur de perception visuelle : inférence multi-têtes rapide et flexible pour la vision robotique
2arXiv cs.RO 

Moteur de perception visuelle : inférence multi-têtes rapide et flexible pour la vision robotique

Une équipe de recherche en robotique a publié sur arXiv (2508.11584v3) une nouvelle version de Visual Perception Engine (VPEngine), un framework open source qui exécute plusieurs tâches de vision robotique en parallèle sur un seul GPU embarqué. Plutôt que de faire tourner un modèle séparé par tâche, ce qui duplique l'extraction de caractéristiques d'image, VPEngine calcule une seule fois la représentation via un backbone de fondation partagé, DINOv2, puis la distribue, sans transfert mémoire GPU-CPU superflu, à plusieurs têtes spécialisées tournant simultanément: dans l'implémentation de démonstration, profondeur, détection d'objets et segmentation sémantique. Les auteurs rapportent jusqu'à 3x d'accélération face à une exécution séquentielle. Bâti sur CUDA Multi-Process Service (MPS) de NVIDIA, le framework garde une empreinte mémoire constante et permet d'ajuster la fréquence d'inférence de chaque tâche en cours d'exécution. Écrit en Python avec des bindings ROS2 C++ pour Humble, il atteint au moins 50 Hz de bout en bout sur une carte NVIDIA Jetson Orin AGX avec des modèles optimisés TensorRT. Cette approche cible un point de friction concret pour les intégrateurs robotiques: la plupart des piles de perception embarquées empilent des modèles indépendants pour la détection, la segmentation ou la profondeur, chacun recalculant sa propre extraction de caractéristiques et saturant la mémoire et le calcul limités d'une carte type Jetson. En mutualisant le backbone plutôt qu'en juxtaposant des processus, VPEngine montre qu'il est possible de cumuler plusieurs capacités de perception en temps réel sans multiplier le matériel, un enjeu direct pour les robots mobiles et humanoïdes déjà contraints en énergie et en calcul embarqué. Le résultat conforte l'hypothèse selon laquelle un backbone de fondation peut servir de tronc commun réutilisable pour plusieurs tâches downstream, réduisant le coût d'ingénierie face à des modèles spécialisés empilés. Il s'agit toutefois d'un framework de recherche évalué sur une implémentation à trois têtes, pas d'un produit déployé en flotte, et le gain de 3x reste propre à cette configuration précise. VPEngine s'inscrit dans une tendance plus large de la recherche robotique visant à rationaliser des piles de perception embarquée où la multiplication des tâches sur du matériel contraint, typiquement les cartes Jetson de NVIDIA, pousse vers des architectures mutualisées plutôt qu'une simple addition de modèles indépendants. Le choix de DINOv2, modèle de fondation pour la vision développé par Meta, comme backbone partagé illustre ce basculement vers la réutilisation de représentations d'image génériques plutôt que l'entraînement de modèles spécialisés bout en bout par tâche. En diffusant le code en open source avec des bindings ROS2 C++ compatibles Humble, l'équipe cible directement la communauté robotique déjà équipée de cette pile logicielle standard, facilitant une adoption sur des plateformes robotiques variées sans réécriture majeure. La mention "replace" sur arXiv signale qu'il s'agit d'une révision, la troisième, d'un article déjà soumis: le travail continue d'être affiné, sans date de version stable ni partenariat industriel annoncé à ce stade.

UELes intégrateurs robotiques européens utilisant ROS2/Jetson pourraient adopter cet outil open source pour leurs piles de perception embarquée, sans acteur ni déploiement européen identifie a ce stade.

RecherchePaper
1 source
TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs
3arXiv cs.RO 

TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs

Une équipe de chercheurs a publié TacVerse, un jeu de données multi-capteurs et benchmark destiné à évaluer la perception tactile par vision (vision-based tactile sensors, VBTS) à travers des capteurs de designs hétérogènes. Le dataset compile 106 800 images tactiles issues de sept capteurs VBTS distincts, couvrant trois tâches cibles : classification de formes, classification de réseaux de rainures (grating), et régression de force. Les expériences sont conduites selon trois protocoles expérimentaux : entraînement intra-capteur, transfert zéro-shot inter-capteurs, et adaptation few-shot. L'article, déposé sur arXiv (2606.25877), ne mentionne pas de financement industriel ni de partenaire de déploiement terrain ; il s'agit d'une contribution académique à visée benchmark, sans produit commercialisé associé. Le résultat le plus structurant pour les intégrateurs robotiques est le gouffre de généralisation inter-capteurs : si les performances intra-capteur sont solides sur les trois tâches, le transfert direct zéro-shot vers un capteur inconnu dégrade significativement les résultats, surtout pour la régression de force et la classification de réseaux de rainures. La classification de forme se révèle comparativement plus robuste face au changement de capteur. L'adaptation few-shot améliore la régression de force sur des capteurs cibles non vus, sans toutefois atteindre les performances intra-capteur. Ce résultat implique qu'un modèle entraîné sur un VBTS donné ne peut pas être déployé tel quel sur un autre design sans dégradation mesurable, ce qui complexifie les stratégies de standardisation des pipelines de perception tactile dans l'industrie. Les capteurs VBTS (type GelSight, DIGIT, Tactip et variantes) ont connu un essor marqué depuis 2018, portés par des labos comme MIT CSAIL et des acteurs industriels comme Meta AI (DIGIT). TacVerse s'inscrit dans un effort de standardisation de l'évaluation, comparable à ce que ImageNet a représenté pour la vision classique. L'étude révèle également que le préentraînement par MAE (Masked Autoencoder) offre les gains les plus constants sur l'ensemble des tâches et des capteurs, suggérant une piste d'architecture prioritaire pour les travaux futurs. Aucun concurrent direct de benchmark tactile multi-capteurs à cette échelle n'est cité dans l'abstract ; TacVerse vise à combler ce vide méthodologique pour la communauté sim-to-real et apprentissage auto-supervisé en perception haptique.

RecherchePaper
1 source
Réseau de perception visuelle multitâche conditionné par un LLM pour la navigation autonome
4arXiv cs.RO 

Réseau de perception visuelle multitâche conditionné par un LLM pour la navigation autonome

Un article de recherche publié en septembre 2026 sur arXiv (référence 2609.14297) décrit un nouveau framework de navigation autonome pour robots de service, baptisé VL-Navigation. Le système associe un réseau de perception visuelle multi-tâches à un grand modèle de langage (LLM) capable d'interpréter des commandes vocales ou textuelles de l'utilisateur. Contrairement aux approches classiques de planification de trajectoire comme A, RRT, DiPPer ou ViT-A, qui s'appuient sur une carte 2D globale et se dégradent avec l'accumulation de dérive odométrique et d'erreurs de capteurs, VL-Navigation génère des plans d'action séquentiels à partir d'indices visuels locaux et d'instructions géométriques égocentriques. La localisation est réinitialisée à chaque cible intermédiaire, ce qui limite l'accumulation de dérive sans nécessiter la maintenance d'une carte globale cohérente. Les chercheurs annoncent des résultats supérieurs aux méthodes existantes sur des données réelles et simulées, sans toutefois publier dans le résumé de chiffres précis de taux de réussite ou de temps de cycle, ce qui invite à la prudence tant que le travail n'a pas été validé par une relecture par les pairs. Le code source est disponible publiquement sur GitHub, sous le dépôt PraveenSingh24/VL-Navigation. Pour les intégrateurs de robots de service, en hôtellerie, en logistique légère ou en environnement hospitalier, ce travail cible un point de friction bien réel: le coût de maintenance des cartes SLAM dans des lieux qui évoluent constamment, mobilier déplacé, couloirs encombrés, zones en travaux. En confiant à un LLM la traduction d'instructions naturelles en plans d'action locaux plutôt qu'à une carte globale figée, l'approche s'inscrit dans la tendance plus large des modèles vision-langage-action qui cherchent à remplacer une partie du pipeline de cartographie classique par du raisonnement contextuel embarqué. Si les résultats se confirment à plus grande échelle, une telle méthode pourrait réduire le temps d'ingénierie nécessaire au déploiement de flottes mobiles dans des environnements partiellement inconnus, un frein récurrent à la commercialisation de la robotique de service au-delà des démonstrations contrôlées. La dérive odométrique cumulative reste un problème non résolu depuis les débuts de la navigation mobile autonome, et les algorithmes de référence cités dans l'article, A, RRT, DiPPer et ViT-A, illustrent les limites successives des approches purement géométriques face à des environnements dynamiques. VL-Navigation se positionne dans la lignée d'autres travaux récents associant modèles de langage et perception visuelle pour la navigation robotique, un champ en pleine expansion en parallèle des modèles VLA appliqués à la manipulation comme Pi-0 ou GR00T N2. Publié comme preprint sans affiliation industrielle mentionnée, l'article ne précise ni calendrier de déploiement pilote ni partenariat commercial; la mise à disposition du code sur GitHub vise avant tout la reproductibilité par la communauté académique, une étape encore éloignée d'une intégration en produit commercial.

RecherchePaper
1 source