Aller au contenu principal
RecherchearXiv cs.RO 

GLIO2 : un système LiDAR-inertiel-GNSS étroitement couplé et parallélisé sur GPU pour une localisation et une cartographie globales robustes en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

GLIO2, un système de localisation et de cartographie présenté sur arXiv par ses auteurs, fusionne LiDAR, centrale inertielle (IMU) et mesures GNSS brutes dans un unique graphe de facteurs à fenêtre glissante, entièrement étroitement couplé. Son front-end, parallélisé sur GPU, optimise conjointement l'alignement de chaque scan LiDAR sur plusieurs scans précédents (scan-to-multiscan), la pré-intégration IMU et les observations GNSS. Sur un NVIDIA Jetson Orin NX, la chaîne complète tourne à environ 25 Hz, soit 39,60 ms par scan. Un back-end hors ligne réutilise les mêmes facteurs en cache pour raffiner toute la trajectoire en lot : la séquence UrbanNav Whampoa (30 minutes, 4,51 km) est traitée en environ 24 secondes. Les auteurs revendiquent la meilleure précision globale parmi les systèmes comparés sur trois benchmarks publics (UrbanNav, MARS-LVIG, M3DGR) et sur leurs propres données de drone et de véhicule. Sur un pont de 5,66 km franchi jusqu'à 96 km/h, où tous les systèmes concurrents divergent à cause de la dégénérescence LiDAR, GLIO2 conserve une précision horizontale de 1,6 m. Le code et les jeux de données sont annoncés, pas encore publiés.

L'intérêt tient à la critique de l'architecture dominante. Les méthodes actuelles alignent chaque scan sur une carte construite de façon incrémentale, qui dérive quand l'environnement est géométriquement pauvre (pont, tunnel, route dégagée) ; une fois l'estimation divergée, l'erreur est irrécupérable. Même sans divergence, un recalage faussé par des objets dynamiques ou de mauvaises correspondances est transmis comme une simple contrainte de pose avec une covariance trop optimiste, ce qui empêche le GNSS de repondérer ou de relinéariser ces correspondances. En les gardant dans le même problème d'optimisation, GLIO2 rend ces corrections possibles. Pour un intégrateur de véhicules autonomes, de drones d'inspection ou de robots d'extérieur, la robustesse en conditions dégradées compte plus que la précision moyenne, et le calcul en temps réel sur un module embarqué de classe Jetson est un argument de déployabilité. Une réserve s'impose : le test du pont repose sur une seule séquence, les baselines sont celles choisies par les auteurs, et la formule « meilleure précision parmi les systèmes évalués » ne vaut que pour ce périmètre.

Ce travail s'inscrit dans la lignée des systèmes LiDAR-inertiels étroitement couplés de type LIO, puis de leurs extensions avec GNSS, qui butent depuis des années sur la dérive de la carte locale et la gestion de la covariance. Les benchmarks retenus, UrbanNav (environnements urbains denses de Hong Kong), MARS-LVIG (données aériennes) et M3DGR (scénarios de dégradation multicapteurs), sont des références pour tester la robustesse. La suite dépendra de la publication effective du code et des données, condition nécessaire pour qu'une reproduction indépendante confirme les résultats, notamment sur des environnements dégradés variés et des plateformes autres que celles des auteurs. Aucun calendrier de diffusion n'est précisé, et il s'agit à ce stade d'une prépublication non évaluée par des pairs.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

IndoorBEV : un système léger de perception BEV par LiDAR en temps réel pour robots mobiles d'intérieur
1arXiv cs.RO 

IndoorBEV : un système léger de perception BEV par LiDAR en temps réel pour robots mobiles d'intérieur

Des chercheurs publient sur arXiv (2610.00355) IndoorBEV, un système de perception LiDAR conçu pour les robots mobiles d'intérieur. Le modèle ne compte que 0,6 million de paramètres et occupe 2,3 Mo de stockage. Sur un NVIDIA AGX Orin, il consomme 21,52 Mo de mémoire GPU par inférence et affiche une latence moyenne de 169,6 ms, pour une échéance de perception fixée à 200 ms. Le taux de dépassement de cette échéance est de 1,8 %. Le système produit simultanément des cartes sémantiques en vue de dessus (BEV, bird's-eye view) et des boîtes englobantes orientées pour les objets. Il repose sur une représentation BEV « consciente de la hauteur » : pour chaque cellule, la distribution verticale des points est résumée par des statistiques de hauteur et un encodage multi-fréquence, ce qui permet à de simples convolutions 2D de traiter une information 3D. Un encodeur léger fusionne ces indices géométriques avec des représentations locales multi-échelles et un contexte global compact, puis des têtes de prédiction découplées génèrent les sorties. L'évaluation couvre des scènes simulées, des scans réels de robots et un jeu de données ouvert de nuages de points d'intérieur. L'enjeu est très concret pour les intégrateurs et les équipes qui embarquent de la perception sur des plateformes à budget calcul limité. Les méthodes à base de points ou de voxels restent coûteuses, tandis que les BEV classiques, issus surtout de la conduite autonome, sacrifient la géométrie verticale, un handicap dans des intérieurs encombrés où tables, étagères, suspensions et objets en surplomb comptent. Avec un modèle de 2,3 Mo, IndoorBEV laisse l'essentiel du GPU disponible pour la navigation, la planification ou d'autres réseaux sur la même machine. Les auteurs affirment ainsi qu'encoder explicitement la hauteur dans une représentation 2D compacte est une voie viable. Quelques réserves s'imposent : il s'agit d'une préimpression non relue par les pairs, une latence moyenne de 169,6 ms sous une échéance de 200 ms laisse une marge mince, soit environ 6 images par seconde, ce qui est modeste pour un robot rapide, et le résumé ne donne aucun chiffre de précision, ni comparaison chiffrée avec des modèles concurrents. L'affirmation d'un « compromis favorable » reste donc à vérifier dans l'article complet. Ce travail s'inscrit dans la série des architectures BEV, popularisées par la conduite autonome (PointPillars, BEVFusion) et désormais adaptées aux contraintes de l'embarqué. Le choix de l'AGX Orin, plateforme de référence pour la robotique mobile, rend les résultats comparables à ce que les intégrateurs déploient réellement. Les concurrents sont les réseaux voxel creux et les approches point à point, plus précis mais plus lourds, ainsi que les modèles de fondation de perception 3D, qui visent la généralité plutôt que la frugalité. Aucune annonce de déploiement industriel, de code ou de pilote n'accompagne la publication à ce stade. La suite logique consisterait à publier des benchmarks comparatifs, à tester le système sur des robots en conditions réelles de logistique ou de service, et à vérifier sa tenue face à des environnements dynamiques et à des capteurs LiDAR de résolutions différentes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Free-Init : initialisation sans scan, sans mouvement et sans mise en correspondance pour systèmes LiDAR-inertiels Doppler
2arXiv cs.RO 

Free-Init : initialisation sans scan, sans mouvement et sans mise en correspondance pour systèmes LiDAR-inertiels Doppler

Un nouveau framework baptisé Free-Init s'attaque à l'un des maillons faibles des systèmes de navigation LiDAR-inertiels : leur phase d'initialisation. Publié sous forme de preprint arXiv (2609.29375), le papier décrit une méthode qui exploite le LiDAR Doppler FMCW, une technologie capable de mesurer non seulement la distance de chaque point mais aussi sa vitesse Doppler radiale. En fusionnant cette vitesse point par point avec les mesures d'une centrale inertielle, sous une modélisation cinématique non inertielle, Free-Init s'affranchit de trois contraintes habituelles de l'initialisation : la correction de distorsion de mouvement des scans LiDAR, l'exigence de mouvements d'excitation spécifiques au démarrage, et la mise en correspondance avec une carte préexistante. Le système fonctionne quel que soit l'état initial de la plateforme, à l'arrêt, en mouvement modéré ou même lors de secousses violentes, et le vélocimètre Doppler-inertiel embarqué délivre des estimations à plus de 10 kHz. Les auteurs annoncent une validation sur plusieurs plateformes et scénarios de mouvement variés, sans toutefois préciser dans le résumé les matériels ou environnements testés, un détail qui reste à vérifier dans le corps du papier. L'enjeu dépasse la seule prouesse technique. Dans les pipelines SLAM et d'odométrie inertielle-LiDAR utilisés par les robots mobiles, drones et véhicules autonomes, l'initialisation reste souvent le point de friction opérationnel : de nombreux systèmes exigent une immobilité initiale ou des manœuvres d'excitation pour estimer l'échelle et l'orientation, ce qui complique un déploiement où l'engin doit être opérationnel dès la mise sous tension, y compris en mouvement. En rendant cette étape indépendante de la trajectoire initiale et des correspondances cartographiques, Free-Init pourrait faciliter l'intégration du LiDAR Doppler FMCW, encore peu répandu face aux LiDAR mécaniques classiques, dans des systèmes de perception embarqués destinés à des conditions réelles plus imprévisibles que les bancs d'essai en laboratoire. Le travail s'inscrit dans la lignée des recherches sur l'initialisation LiDAR-inertielle, longtemps limitée par l'absence de mesure directe de vitesse dans les LiDAR traditionnels, un manque que l'effet Doppler des capteurs FMCW vient combler. Présenté comme compatible plug-and-play avec les architectures LiDAR-inertielles existantes, Free-Init reste à ce stade une contribution académique publiée en preprint, sans indication d'intégration industrielle ni de partenaire commercial annoncé.

RecherchePaper
1 source
Graphes de scène probabilistes : représentation hiérarchique et système en temps réel
3arXiv cs.RO 

Graphes de scène probabilistes : représentation hiérarchique et système en temps réel

Des chercheurs présentent dans un nouvel article publié sur arXiv (référence 2609.23144v1) un système de représentation de scènes 3D pour la perception robotique baptisé Probabilistic Scene Graph (PSG). Contrairement aux scene graphs classiques, qui figent une structure d'entités, de relations et d'attributs sémantiques, PSG modélise une distribution de probabilité sur l'ensemble des graphes possibles : une structure discrète (objets, relations, sémantique) couplée à des états continus qui les situent dans l'espace, avec une incertitude explicite sur les deux composantes. La géométrie est portée directement par les nœuds plutôt que puisée dans une carte métrique construite à part ; la carte, quand elle est utile, découle du graphe et non l'inverse. Les auteurs instancient cette idée via des Hierarchical Graphs of Gaussians (HGG) : chaque objet est représenté par une gaussienne à covariance complète sous une croyance Normal-Inverse-Wishart, le même schéma étant réappliqué récursivement pour affiner la résolution de surface. Le pipeline combine un alignement grossier-vers-fin fondé uniquement sur le graphe et une optimisation imbriquée Expectation-Maximization / factor-graph qui raffine conjointement poses, paramètres d'objets et géométrie interne. Testé sur six jeux de données (intérieur RGB-D, extérieur LiDAR, scénarios multimodaux), le système tourne à la cadence des capteurs avec une mémoire quasi constante. Ce travail cible une limite structurelle des scene graphs 3D en robotique : l'incertitude y est aujourd'hui traitée en aval, jamais propagée pendant la construction du graphe lui-même. Pour les équipes développant des piles de perception pour navigation autonome, manipulation ou SLAM sémantique, cette lacune fragilise les graphes face au bruit capteur ou aux fusions d'observations erronées. En couplant nativement structure sémantique et incertitude géométrique, PSG vise des cartes robustes même avec des données partielles ou ambiguës, un enjeu direct pour les intégrateurs fusionnant des capteurs hétérogènes en conditions réelles. Les résultats revendiqués, précision « état de l'art » et alignement de graphe en zero-shot, restent des mesures de benchmark académique et non un déploiement industriel validé. L'approche prolonge les travaux sur les scene graphs 3D hiérarchiques utilisés en robotique pour structurer la perception au-delà des nuages de points ou cartes d'occupation, mais rompt avec ces systèmes déterministes en adoptant un cadre bayésien complet où chaque étape (association, fusion, raffinement de pose) manipule des croyances plutôt que des estimations ponctuelles. Elle se positionne face aux pipelines de cartographie sémantique classiques et aux méthodes de reconstruction par gaussiennes issues de la vision par ordinateur, dont elle reprend la représentation continue en l'intégrant à une structure de graphe discrète. L'article, classé comme nouvelle soumission arXiv, ne mentionne aucun partenariat industriel ni feuille de route de déploiement : c'est à ce stade une contribution de recherche évaluée sur données publiques, dont l'adoption dépendra de sa reproduction par la communauté.

RecherchePaper
1 source
IA robuste pour manipuler les tissus grâce au raffinement en temps réel par simulation
4arXiv cs.RO 

IA robuste pour manipuler les tissus grâce au raffinement en temps réel par simulation

Une équipe de recherche a publié le 24 juin 2026 sur arXiv (arXiv:2606.24552) une méthode permettant à un robot de manipuler des textiles souples à partir d'une unique image RGB, sans capteur de profondeur ni données haptiques. L'approche repose sur trois composants : un simulateur d'objets déformables appelé FLASH, conçu pour équilibrer fidélité physique, stabilité numérique et vitesse de rollout ; un module real-to-sim entraîné exclusivement sur données synthétiques, qui convertit une image couleur en état de tissu compatible avec la simulation en fusionnant des features visuelles préentraînées avec des tokens canoniques apprenables ; enfin un planificateur en ligne MPPI (Model Predictive Path Integral) guidé par une politique distillée hors ligne, qui évalue des lots de trajectoires candidates en parallèle dans le simulateur et sélectionne la meilleure action à chaque pas. Les expériences sur robot réel montrent des taux de succès et une robustesse supérieurs aux méthodes de référence, bien que les chiffres précis ne soient pas communiqués dans le résumé public. Ce travail est significatif parce qu'il étend le paradigme "simulator-in-the-loop" aux objets déformables, un verrou majeur en manipulation robotique. Jusqu'ici, cette famille de méthodes était cantonnée aux objets rigides, dont l'état et les contacts restent relativement faciles à modéliser. Le textile pose un problème radicalement plus difficile : l'espace de configuration est continu et de très haute dimension, les contacts sont multiples et transitoires, et le sim-to-real gap explose dès que le simulateur ne capture pas fidèlement les plis. Le fait que la méthode ne nécessite qu'une caméra RGB standard abaisse le coût d'intégration en contexte industriel, notamment pour le pliage de vêtements, la manipulation de sacs flexibles ou les lignes de confection textile. Pour un intégrateur B2B, c'est un signal que le sim-to-real pour déformables commence à sortir du laboratoire, même si les performances annoncées restent à valider sur un spectre large de matières et de géométries. La manipulation de textiles reste l'un des problèmes ouverts les plus cités en robotique d'entrepôt depuis les travaux fondateurs de Maitin-Shepard (2010) sur le pliage de serviettes, et le champ a longtemps stagné faute de simulateurs déformables suffisamment rapides pour un usage en boucle fermée. FLASH s'inscrit dans une vague récente de simulateurs spécialisés (DiffCloth, FleX, CLOTH3D) cherchant ce compromis fidélité/vitesse. Côté concurrence, les approches dominantes pour la manipulation de textiles restent les politiques imitatives par diffusion (comme Pi-0 de Physical Intelligence) ou le transfert pur sim-to-real par domain randomization. L'originalité ici est de placer le simulateur directement dans la boucle d'inférence plutôt qu'uniquement à l'entraînement. La prochaine étape naturelle sera de tester à plus grande échelle de variabilité de tissus et d'intégrer des retours tactiles pour les cas où la vision seule est insuffisante ; l'article ne mentionne pas de partenariats industriels ni de calendrier de déploiement.

RecherchePaper
1 source