Aller au contenu principal
RecherchearXiv cs.RO 

Noctif3R : SLAM monoculaire en temps réel à propagation avant pour scènes à faible luminosité sur matériel embarqué

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (2609.21114v1) présente Noctif3R, un système de SLAM monoculaire temps réel pour robots devant se localiser avec une seule caméra RGB en très basse lumière, sur un calculateur embarqué. Sur les neuf niveaux d'obscurité les plus sévères testés, les systèmes existants échouent massivement : DROID-SLAM renvoie une trajectoire sans aucune information exploitable sur les neuf, VGGT-SLAM et CUT3R sur huit, pi^3 sur sept, DPV-SLAM sur quatre. Noctif3R, qui combine un front-end feed-forward de cartes de points et une porte de mise en correspondance explicite, ne renvoie que des trajectoires exploitables, avec une erreur de 24 à 47% du plafond « sans information » contre 56 à 73% pour la meilleure référence. Sur une vidéo réelle d'un robot Spot de Boston Dynamics où 86,5% des 1178 images sont entièrement noires, Noctif3R s'arrête après la partie éclairée alors que DROID-SLAM et DPV-SLAM produisent une pose pour chaque image ; porté sur Jetson AGX Orin, le pipeline gagne jusqu'à 1,42x de débit pour 0,68x d'erreur, avec 47% de mémoire GPU et 29% d'énergie par pose en moins.

L'apport principal n'est pas la seule précision en basse lumière, mais la disparition du faux positif silencieux : la plupart des pipelines temps réel continuent de renvoyer une pose même sans information exploitable, un risque pour un robot autonome puisque rien ne signale l'échec. En refusant de tracker plutôt que d'halluciner une trajectoire, Noctif3R répond à un besoin des intégrateurs opérant en environnements sombres (inspection industrielle, entrepôts sans éclairage), où détecter l'échec compte autant que la précision. Le travail confirme aussi que l'écart entre reconstruction basse lumière hors ligne, précise mais trop lente, et SLAM temps réel embarqué reste largement ouvert, et qu'il nécessite des architectures dédiées plutôt qu'un simple durcissement des pipelines existants.

Le système s'inscrit dans la lignée du SLAM visuel embarqué, un domaine dont les références actuelles, dont DROID-SLAM et DPV-SLAM, ont surtout été conçues pour la lumière normale ; Noctif3R se positionne contre elles sur les mêmes échelles de noirceur. L'évaluation s'appuie sur trois jeux de données : une échelle de bruit calibrée et reproductible, des expositions réelles ré-annotées, et une nouvelle échelle vidéo en chambre noire filmée avec un robot Spot de Boston Dynamics. Il s'agit à ce stade d'un travail de recherche publié sur arXiv, sans produit ni déploiement commercial annoncé.

À lire aussi

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure
1arXiv cs.RO 

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure

Des chercheurs ont publié en mai 2026 (arXiv:2605.17661) Mono-Hydra++, un pipeline temps réel capable de construire des graphes de scène 3D hiérarchiques d'intérieurs en n'utilisant qu'une caméra RGB monoculaire et une IMU, sans capteur de profondeur actif. Le coeur du système repose sur M2H-MX, un modèle multi-tâches fondé sur DINOv3 qui estime simultanément la profondeur et la sémantique des images. Ces estimations alimentent un front-end d'odométrie visuelle-inertielle (VIO) enrichi de contraintes de profondeur prédites creuses, d'un masquage sémantique des zones dynamiques et d'un alignement temporel tenant compte de la pose, avant fusion volumétrique dans le backend Mono-Hydra. Sur le sous-ensemble d'évaluation Go-SLAM/ScanNet, le système affiche 1,6 % d'erreur de trajectoire en moins que le meilleur baseline RGB-D testé ; sur le benchmark calibré 7-Scenes, il réduit l'ATE moyen de 29,8 % par rapport au meilleur concurrent calibré. Le modèle de perception M2H-MX-L, exporté en ONNX/TensorRT FP16, tourne à 25,53 FPS sur un Jetson Orin NX 16 Go, et le pipeline a été validé dans un déploiement réel dans un bâtiment ITC avec une caméra RealSense RGB + IMU. L'impact industriel est direct pour les plateformes à contraintes sévères : drones d'inspection, robots humanoïdes légers et AMR embarquant peu de puissance. Jusqu'ici, la construction de graphes de scène 3D, qui organisent l'espace en objets, pièces et relations spatiales, nécessitait des capteurs actifs (RGB-D ou LiDAR) impraticables dès que le payload ou la consommation électrique sont limités. Mono-Hydra++ démontre qu'il est possible d'atteindre, voire de dépasser, la précision de ces baselines lourds avec une seule caméra et une IMU bas coût. Pour un intégrateur ou un COO industriel, cela signifie une réduction substantielle du coût matériel embarqué et l'ouverture de cas d'usage où le RGB-D n'est pas envisageable. Il convient toutefois de noter que les résultats sont issus de benchmarks académiques standardisés : la robustesse sur des scènes industrielles non contrôlées, avec éclairages difficiles ou textures répétitives, reste à confirmer dans des conditions opérationnelles réelles. Mono-Hydra++ s'inscrit dans la lignée du système Hydra du MIT, qui a posé les bases de la représentation hiérarchique en graphe de scène pour la robotique. L'utilisation de DINOv3 comme backbone de vision fondationnelle est cohérente avec la tendance forte à extraire simultanément géométrie et sémantique depuis des modèles pré-entraînés à grande échelle. Sur ce terrain, les concurrents directs incluent les systèmes basés sur RGB-D comme Go-SLAM, iMAP ou NICE-SLAM, ainsi que des approches VIO-sémantiques récentes, mais peu proposent la combinaison complète cartographie métrique, sémantique et graphe de scène en temps réel sur matériel embarqué contraint. En tant que preprint arXiv non encore évalué par les pairs, les prochaines étapes attendues sont la publication en conférence (IROS, ICRA), des tests sur plateformes aériennes effectives et une éventuelle intégration dans des stacks robotiques open-source comme ROS 2.

UELes constructeurs européens d'AMR légers et de drones d'inspection pourraient à terme réduire leurs coûts matériels embarqués en remplaçant les capteurs RGB-D par une caméra monoculaire, sous réserve de validation dans des conditions industrielles non contrôlées.

RecherchePaper
1 source
AsyncMDE : estimation de profondeur monoculaire en temps réel via mémoire spatiale asynchrone
2arXiv cs.RO 

AsyncMDE : estimation de profondeur monoculaire en temps réel via mémoire spatiale asynchrone

Des chercheurs ont publié sur arXiv (arXiv:2603.10438v2) AsyncMDE, un système de perception de profondeur monoculaire asynchrone conçu pour permettre un déploiement temps-réel sur plateformes embarquées. L'architecture dissocie deux chemins d'exécution : un modèle fondation "slow path" de 97,5 millions de paramètres, figé, qui génère périodiquement des représentations spatiales de haute qualité en arrière-plan ; et un "fast path" léger de seulement 3,83 millions de paramètres entraînables, qui tourne en parallèle en réutilisant ces features via une fusion complémentaire avec l'observation courante et une mise à jour autorégressive de la mémoire. Sur GPU RTX 4090, le fast path atteint 237 FPS. Sur Jetson AGX Orin optimisé TensorRT, la cible embarquée réaliste pour la robotique mobile, il tourne à 161 FPS tout en récupérant 77 % de l'écart de précision par rapport au modèle fondation complet. L'enjeu industriel est direct : l'estimation de profondeur monoculaire à base de modèles fondation constitue une alternative crédible aux capteurs actifs (LiDAR, ToF), mais leur coût computationnel les rendait jusqu'ici incompatibles avec les contraintes temps-réel des robots mobiles et des AMR. AsyncMDE répond à ce verrou en amortissant le coût du modèle lourd sur plusieurs frames consécutives, en exploitant la redondance spatiale naturelle des déplacements continus d'un robot. La dégradation de précision est bornée et prédictible sur trois benchmarks couvrant des scènes statiques, dynamiques et des mouvements extrêmes synthétiques, ce qui est plus rassurant que des métriques moyennes masquant les cas limites. La profondeur monoculaire est un champ de recherche en forte accélération depuis que les architectures Vision Transformer et les modèles fondation (DPT, Depth Anything, UniDepth) ont montré des généralisations zero-shot solides, mais le goulot computationnel restait le principal obstacle à l'embarquement. AsyncMDE s'inscrit dans une tendance plus large d'inférence asynchrone et de caching de features, similaire aux approches utilisées en détection vidéo temps-réel. Les concurrents directs incluent les méthodes de distillation de modèles fondation (par exemple MobileDepth, FastDepth) et les pipelines LiDAR-caméra fusion légère. La prochaine étape naturelle sera de valider ces chiffres sur des robots réels en navigation autonome, où la latence bout-en-bout, et non le seul débit du réseau, détermine l'utilisabilité.

RecherchePaper
1 source
SurfSLAM : reconstruction stéréo sous-marine par transfert simulation-réel pour SLAM en temps réel
3arXiv cs.RO 

SurfSLAM : reconstruction stéréo sous-marine par transfert simulation-réel pour SLAM en temps réel

Des chercheurs présentent SurfSLAM, un système de localisation et cartographie simultanées (SLAM) sous-marin en temps réel, décrit dans un article arXiv (2601.10814, version 3, mise a jour d'un preprint existant). Le système s'appuie sur des cameras stéréo pour estimer la profondeur métrique, fusionnée avec des mesures IMU, barométriques et Doppler Velocity Log (DVL). Pour entrainer le réseau d'estimation de disparité stéréo, les auteurs utilisent un pipeline sim-to-real combinant données simulées et un finetuning auto-supervise sur données réelles, contournant l'absence de jeux de données stéréo sous-marins annotes. L'équipe a aussi collecte un dataset inédit de plus de 24 000 paires stéréo capturées par un robot sous-marin lors de relevés d'épaves de navires, avec modèles de photogrammétrie dense et trajectoires de référence pour l'évaluation. Cette avancée s'attaque a un verrou connu de la perception sous-marine: les réseaux stéréo entraines sur des images terrestres ne se transfèrent pas directement au milieu aquatique, ou l'atténuation lumineuse, les artefacts visuels, l'éclairage dynamique et le manque de texture des scènes dégradent fortement les performances. Pour les intégrateurs de robots sous-marins actifs dans l'inspection offshore, l'archéologie subaquatique ou la surveillance d'infrastructures, une odométrie visuelle stéréo fiable en temps réel constitue une brique critique la ou les capteurs acoustiques seuls restent couteux ou peu précis. En démontrant un gain mesurable sur des données réelles complexes, l'étude apporte une preuve empirique que l'approche sim-to-real, déjà éprouvée en robotique terrestre, peut se transposer au sous-marin sans exiger un volume massif de données réelles annotées. Le travail s'inscrit dans une lignée de recherches visant a combler le manque chronique de jeux de données stéréo sous-marins réels, frein historique au SLAM visuel en mer, longtemps domine par les approches acoustiques (sonar) ou par des méthodes monoculaires moins précises metriquement. Publie sur arXiv comme mise a jour d'un preprint antérieur, SurfSLAM reste a ce stade une contribution académique plutôt qu'un produit commercialise, et l'article ne précise ni institution porteuse ni partenariat industriel. Les auteurs positionnent leur dataset de relevés d'épaves comme benchmark réutilisable pour la communauté, ouvrant la voie a des comparaisons avec d'autres frameworks de SLAM sous-marin et a une adoption future par des opérateurs de robots d'inspection cherchant une alternative moins couteuse aux capteurs acoustiques.

RecherchePaper
1 source
TacPAC : prédiction tactile, correction d'action en temps réel, modèles monde-action pour manipulation à contacts riches
4arXiv cs.RO 

TacPAC : prédiction tactile, correction d'action en temps réel, modèles monde-action pour manipulation à contacts riches

Des chercheurs du Logos Robotics Group ont publié le 7 septembre 2026 sur arXiv (2609.05266) TacPAC, un mécanisme de correction tactile en temps réel pour les modèles monde-action de manipulation robotique. Alors que ces modèles planifient habituellement leurs actions à partir de prédictions purement visuelles des observations futures, TacPAC met en cache le contact prédit lors de la planification, ainsi que la représentation du plan lui-même, puis compare chaque image tactile réellement perçue à ce cache pour corriger, en cours d'exécution, les actions pas encore jouées. Sur cinq tâches réalisées avec un robot réel, insertion de précision, manipulation d'objets fragiles, réorientation d'objets et manipulation à long horizon, le taux de réussite moyen passe de 22% pour le modèle de référence purement visuel à 64% avec TacPAC, pour un coût de correction 20,7 fois inférieur à celui d'une régénération complète du segment d'actions. Le code est publié sur GitHub sous LogosRoboticsGroup/TacPAC. Ce résultat cible une faiblesse connue des modèles vision-langage-action et monde-action: leur cécité aux repères de contact locaux, pourtant déterminants dans les tâches riches en contact comme l'assemblage de précision ou la manipulation d'objets fragiles. Les auteurs montrent surtout qu'ajouter la prédiction tactile comme simple vue supplémentaire ne récupère qu'un tiers du gain possible, à cause d'un décalage temporel entre la prédiction, qui précède l'action, et le retour tactile, qui arrive pendant son exécution. Pour les intégrateurs industriels, la leçon dépasse le simple ajout d'un capteur tactile: sans boucle de correction dédiée exploitant ce que le plan avait anticipé, le tactile apporte peu de gain réel, un point qui tempère l'enthousiasme actuel autour des modèles génératifs multimodaux appliqués à la manipulation fine. Le travail prolonge la lignée des modèles monde-action qui conditionnent la génération d'actions sur des observations futures prédites, une approche jusqu'ici centrée sur la vision et illustrée par des systèmes comme Pi-0, GR00T N2 ou Helix. TacPAC reste un article de recherche déposé sur arXiv, pas un produit commercial ni un déploiement industriel: ses résultats portent sur cinq tâches en laboratoire avec un seul robot, sans précision sur le nombre d'essais ni sur une généralisation à d'autres plateformes ou bras robotiques. Le code source ouvert laisse toutefois la porte à une reprise par d'autres équipes de recherche en manipulation robotique. Aucun acteur français ou européen n'apparaît dans cette publication.

RechercheActu
1 source