Apprendre à quelles correspondances se fier : localisation par caméra événementielle pondérée par la confiance dans des cartes LiDAR
Des chercheurs proposent CELL, une méthode de localisation de caméras événementielles (évent cameras) dans des cartes LiDAR préconstruites, qui apprend à pondérer chaque correspondance selon sa fiabilité. Le pipeline de référence traite le problème en deux temps: estimation d'un flux optique dense entre une vue de profondeur rendue depuis la carte et l'image d'événements, puis résolution d'un Perspective-n-Point (PnP) sur les correspondances 3D-2D ainsi obtenues. Les travaux publiés sur arXiv (2610.11967) évaluent le système sur les jeux de données M3ED et DSEC. Face à la base de comparaison LEAR, CELL améliore les résultats sur la majorité des séquences testées, avec une réduction de l'erreur médiane de translation allant jusqu'à 26,9 % et de l'erreur médiane de rotation jusqu'à 15,8 %. Ces gains sont des maxima observés sur les meilleures séquences, pas des moyennes, et aucune évaluation embarquée ni mesure de latence n'est mentionnée.
L'apport tient à la façon d'apprendre la confiance. Les approches existantes s'appuient sur un consensus géométrique lors de l'estimation de pose, sans modéliser la fiabilité d'une correspondance ni son « informativité » pour la pose, c'est-à-dire la force avec laquelle elle contraint la caméra. Les auteurs montrent que la solution intuitive, supervisée par l'erreur en pixels de chaque correspondance, souffre d'un biais lié à la profondeur: les petites erreurs se concentrent à grande distance, là où les points contraignent peu la pose. CELL apprend donc la confiance de bout en bout à travers la pose, via un PnP probabiliste différentiable dont le terme de log-partition favorise des pondérations produisant une distribution de pose mieux contrainte. Cette confiance sert trois fois: elle repondère la supervision du flux dans un entraînement découplé qui isole le backbone flux/contours des gradients de pose, elle pilote une sélection probabiliste des correspondances à l'inférence, et elle pondère, avec la probabilité de contour du réseau, une dernière étape de raffinement par appariement de contours. Une représentation de profondeur à complétion partielle ajoute de l'information sans halluciner sur les grands vides.
Pour la robotique mobile et les véhicules autonomes, l'enjeu est la localisation robuste sur cartes LiDAR existantes avec des capteurs événementiels, peu sensibles au flou de mouvement et aux forts contrastes lumineux. Le résultat suggère que mieux choisir les correspondances à utiliser rapporte autant que mieux les estimer, et que le signal de supervision compte: l'erreur locale seule trompe l'apprentissage. Reste à voir la généralisation hors M3ED et DSEC et la tenue en temps réel, deux points que le résumé ne documente pas. Cette recherche s'inscrit dans la continuité de LEAR, qui reste la référence directe, et ne relève ni d'un produit ni d'un déploiement industriel.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




