Aller au contenu principal
DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles
RecherchearXiv cs.RO 

DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire AUBVRL ont publié sur arXiv le 25 juin 2026 DSP-SLAM++, une extension du système DSP-SLAM conçue pour cartographier simultanément plusieurs classes d'objets en temps réel avec une fidélité géométrique élevée. Le système repose sur un pipeline de cartographie asynchrone, où le thread de mapping tourne indépendamment du thread de suivi, ce qui permet de traiter des séquences multi-classes à 25 Hz sans bloquer l'ensemble du pipeline. Couplé à une suite sensorielle fisheye monoculaire et LiDAR, DSP-SLAM++ réduit la latence maximale de traitement des objets jusqu'à 70 % par rapport à la baseline DSP-SLAM d'origine, tout en produisant des reconstructions 3D géométriquement complètes pour chaque objet détecté. Le code est disponible en open source sur GitHub (AUBVRL/DSP-SLAMpp).

Ce résultat compte parce que le trilemme classique du SLAM orienté objets, choisir entre temps réel, support multi-classes et fidélité des modèles 3D, restait non résolu dans les systèmes existants. Un gain de 70 % sur la latence maximale (et non sur une latence moyenne, détail important) signifie que les cas extrêmes, ceux qui gelaient le thread de cartographie sur des scènes denses, sont maîtrisés. Pour un intégrateur qui équipe un véhicule autonome ou un bras de manipulation, c'est la différence entre un système testé en labo et un système opérationnel sur plateforme embarquée réelle. L'adaptation fisheye-LiDAR est également stratégique : ce binôme est devenu la configuration standard en robotique terrain et en conduite autonome niveau 2-3, là où les caméras rectilignes coûtent en champ de vue.

DSP-SLAM, le prédécesseur direct, était lui-même une extension de SuperPoint SLAM publiée autour de 2021-2022 et avait démontré la viabilité des représentations implicites par réseaux de formes (DeepSDF-style) pour le SLAM objet, mais butait sur les performances en environnements multi-classes et multi-capteurs. Dans l'espace concurrent, on trouve EAO-SLAM, OrcVIO ou encore les approches NeRF-SLAM (iMAP, NICE-SLAM), qui privilégient la reconstruction de scènes complètes au détriment de la sémantique par objet. DSP-SLAM++ se positionne donc sur le créneau précis de la granularité objet à haute fidélité en temps réel, créneau directement utile pour la manipulation robotique (pick-and-place avec modèle 3D précis) et la détection d'obstacles typés en conduite autonome. Les prochaines étapes logiques incluent l'extension à des classes ouvertes via des fondations visuelles (SAM, DINO) et les tests sur plateformes embarquées contraintes comme Jetson Orin.

Impact France/UE

Le code open source disponible sur GitHub est directement exploitable par les intégrateurs européens en robotique terrain et conduite autonome, sans dépendance commerciale envers un fournisseur tiers.

À lire aussi

RoboBRIDGE : un cadre modulaire pour connecter des politiques à des agents robotiques fiables en conditions réelles
1arXiv cs.RO 

RoboBRIDGE : un cadre modulaire pour connecter des politiques à des agents robotiques fiables en conditions réelles

Des chercheurs proposent RoboBRIDGE, un framework modulaire destiné à transformer un modèle Vision-Language-Action (VLA) pré-entraîné en agent robotique réellement déployable. L'architecture ajoute une couche d'orchestration composée de cinq modules coordonnés : un Monitor qui détecte rapidement les échecs et déclenche une récupération hiérarchique avant qu'ils ne s'aggravent, un Perceptor qui met à jour la compréhension de la scène de façon asynchrone, un Planner qui replanifie dès que l'environnement s'écarte du plan initial, un Controller qui découpe la manipulation en primitives invariantes au domaine via des adaptateurs LoRA dédiés, et une interface robot générique. Le système a été testé sur les benchmarks LIBERO et RoboCasa ainsi que sur des cas réels couvrant plusieurs plateformes robotiques et plusieurs modèles VLA de référence, où il surpasse systématiquement les politiques autonomes et les déploiements VLA augmentés existants. L'enjeu dépasse la simple performance sur benchmark. Les modèles VLA sont aujourd'hui de bons prédicteurs d'action isolés, mais leur mise en production révèle des lacunes structurelles : aucune récupération après échec, exécution incohérente sur des tâches longues, et fragilité dès que les observations, les tâches ou l'embodiment changent. RoboBRIDGE s'attaque directement à l'écart classique entre démonstration et réalité opérationnelle qui freine l'adoption des VLA en robotique industrielle. Le message central des auteurs est net : la fiabilité d'un agent robotique ne vient pas de la seule montée en échelle du prédicteur d'action, mais d'une orchestration structurée autour de lui, un argument qui pèse dans le débat sur la voie à suivre pour la robotique fondée sur les modèles de fondation. Jusqu'ici, les solutions existantes traitaient ces limites séparément, via un réentraînement complet du modèle ou des modules spécifiques à un environnement donné, deux approches coûteuses et peu généralisables. RoboBRIDGE se positionne comme une alternative générique compatible avec des composants VLA du commerce, sans réentraînement lourd. Le papier, publié sur arXiv, reste au stade de la recherche académique ; aucun partenaire industriel ni calendrier de déploiement commercial n'est mentionné à ce stade.

RechercheActu
1 source
FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques
2arXiv cs.RO 

FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques

Une équipe de chercheurs a publié sur arXiv (référence 2605.18047) FUSE, un cadre logiciel pour l'estimation d'état unifiée dans les systèmes SLAM robotiques. Le problème adressé est structurel : les architectures SLAM à couplage serré lient dans un même bloc monolithique le traitement temporel, l'association géométrique locale, la formulation de l'estimateur et la politique de mise à jour de carte, rendant toute modification d'un composant coûteuse. FUSE propose quatre interfaces standardisées (ingestion d'observations, propagation, mise à jour, requête d'état) pour séparer ces responsabilités. L'instanciation LiDAR-IMU a été évaluée sur une séquence corridor bouclée de 418 m et produit une erreur de trajectoire de 1,626 m bout en bout, soit une réduction relative de 7,9 % par rapport à Faster-LIO, meilleure référence sur cette séquence. Le gain de 7,9 % reste modeste, mais l'intérêt principal de FUSE est architectural. Découpler proprement les choix de conception dans un pipeline SLAM permet de changer l'estimateur, adapter la cadence de mise à jour ou intégrer un nouveau type de capteur sans réarchitecturer l'ensemble du système. Pour les intégrateurs d'AMR ou les équipes de navigation industrielle, cela réduit significativement le coût de portage entre plateformes. La gestion explicite de la dégénérescence directionnelle constitue un point technique concret : en environnement corridor, le LiDAR ne perçoit pas de contraintes suffisantes dans l'axe latéral, rendant l'estimation instable. FUSE intègre un mécanisme de correction adaptatif ciblant ces directions faiblement observables, un problème rarement traité proprement dans les frameworks publics existants. Le SLAM LiDAR-IMU est un domaine très concurrentiel. Les références académiques dominantes incluent FAST-LIO2 et Faster-LIO (équipe Cai, HKUST) ainsi que LIO-SAM (Shan et al., MIT). Dans l'industrie, des fournisseurs comme Exotec (France) ou MiR intègrent des stacks de localisation dérivées de ces travaux dans leurs flottes d'AMR. FUSE ne cherche pas à battre ces systèmes sur les benchmarks de performance pure, mais à proposer une abstraction permettant de composer des composants algorithmiques de façon indépendante. Il s'agit d'une prépublication arXiv sans code public annoncé à ce stade, ce qui en fait pour l'instant une contribution académique à valider plutôt qu'un outil industriel prêt à l'emploi. La suite logique serait une mise à disposition open-source permettant de tester des instanciations alternatives, radar ou RGB-D, à travers les mêmes interfaces standardisées.

UEExotec (France) est cité comme exemple d'intégrateur AMR susceptible de bénéficier de l'abstraction architecturale proposée ; une mise à disposition open-source de FUSE réduirait le coût de portage SLAM pour les équipes de navigation industrielle européennes.

RecherchePaper
1 source
Cadre multi-dynamique unifié pour la modélisation orientée perception des robots continus à tendons
3arXiv cs.RO 

Cadre multi-dynamique unifié pour la modélisation orientée perception des robots continus à tendons

Des chercheurs ont publié sur arXiv (référence 2511.18088v2) un cadre de modélisation multi-dynamique unifié pour les robots continus à tendons, illustré par un prototype baptisé Spirob, dont la géométrie s'inspire d'une spirale. Le modèle intègre trois niveaux couplés : la dynamique électrique des moteurs, la dynamique moteur-treuil, et la dynamique structurelle du corps continu. En exploitant les signaux moteurs internes, courant et déplacement angulaire, le système est capable de détecter des interactions physiques avec l'environnement sans aucun capteur externe. Trois capacités ont été validées expérimentalement : détection passive de contact, détection active de contact avec stratégie de contrôle issue de la simulation, et estimation de la taille d'objets via une politique apprise en simulation puis déployée directement sur le robot réel. Le modèle reproduit fidèlement deux comportements critiques du système physique : l'hystérésis d'actionnement et l'auto-contact aux limites de mouvement. L'intérêt industriel de cette approche tient à l'élimination des capteurs extéroceptifs, qui alourdissent l'intégration hardware et fragilisent la scalabilité des déploiements. En ancrant la perception dans la dynamique intrinsèque du robot, les auteurs proposent une voie vers des robots plus compacts et moins coûteux à maintenir. Plus significatif encore : le transfert simulation-réel fonctionne sans adaptation supplémentaire pour la détection de contact active et l'estimation dimensionnelle, ce qui suggère que le modèle capte suffisamment les non-linéarités physiques pour que les politiques apprises en sim soient directement exploitables. C'est un point non trivial dans le domaine des robots souples, où le sim-to-real gap reste un obstacle structurel bien documenté. Les robots continus à tendons occupent une niche spécifique : manipulation en espace confiné, interventions médicales mini-invasives, inspection de conduites. Des laboratoires comme BioRobotics Institute (Scuola Superiore Sant'Anna), CHARM Lab (Stanford) ou des équipes EPFL travaillent sur des architectures comparables. Côté perception intrinsèque, la tendance rejoint les travaux sur la proprioception apprise pour robots souples (ex. travaux de Google DeepMind sur les robots déformables). Spirob reste pour l'instant un prototype de recherche, et l'article ne mentionne ni partenaire industriel, ni horizon de commercialisation. La prochaine étape logique serait une validation sur des tâches de manipulation plus complexes ou dans des configurations multi-robots.

UEDes laboratoires européens comme l'EPFL et le BioRobotics Institute (Sant'Anna, Italie) travaillent sur des architectures comparables, positionnant l'UE dans ce segment de recherche sur les robots souples à destination des applications médicales mini-invasives et de l'inspection industrielle.

RecherchePaper
1 source
Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles
4arXiv cs.RO 

Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles

Des chercheurs présentent APT-RL (Action Pretrained Transformer-based Reinforcement Learning), un framework unifié permettant à un robot quadrupède de franchir des terrains complexes en n'utilisant que ses capteurs et son calcul embarqués, sans dépendre d'une infrastructure externe. La méthode génère d'abord des jeux de données de mouvement 2D à grande échelle via optimisation de trajectoires sur une dynamique simplifiée, ce qui permet d'entraîner des compétences de locomotion variées et réutilisables. Ces compétences servent ensuite de base solide pour apprendre des tâches plus complexes en 3D, avec transition autonome entre différentes allures. Lors des tests en conditions réelles, le robot a exécuté des manœuvres agiles à travers des obstacles intérieurs et extérieurs, y compris des sauts en descente dynamiques atteignant une vitesse de pointe instantanée de 6 mètres par seconde. Une seule politique embarquée lui a permis de franchir escaliers, haies, pierres de gué, trous et branches tombées au sol, sans changer de modèle selon le type d'obstacle. L'intérêt de ce travail réside dans sa capacité à combiner plusieurs compétences motrices en un seul système embarqué et autonome, un point de friction connu dans la robotique quadrupède où la plupart des démonstrations reposent encore sur des politiques spécialisées par terrain ou sur une assistance en calcul déporté. En s'appuyant uniquement sur la perception et le calcul embarqués, APT-RL s'attaque directement à l'écart classique entre simulation et réalité, tout en montrant que des priors de mouvement générés à moindre coût en 2D peuvent se généraliser efficacement à des environnements 3D non structurés. Pour les intégrateurs travaillant sur l'inspection industrielle, la robotique de terrain ou les interventions en environnement accidenté, cela représente une piste concrète vers des robots capables de gérer la diversité des obstacles réels sans reconfiguration manuelle entre chaque scénario. Ce travail s'inscrit dans la lignée des recherches récentes en apprentissage par renforcement pour la locomotion des robots à pattes, un domaine où des plateformes comme Unitree Go2, Boston Dynamics Spot ou ANYbotics ANYmal servent de référence pour les capacités tout-terrain. Publié comme preprint sur arXiv, l'article ne précise ni laboratoire porteur ni calendrier de déploiement commercial : il s'agit à ce stade d'une contribution de recherche, sans indication de produit shippé ni de pilote industriel annoncé.

RecherchePaper
1 source