LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne
Une équipe de recherche a publié une version révisée de l'article LatentAM sur arXiv (référence 2602.12314), qui présente un système de cartographie 3D par Gaussian Splatting en ligne destiné à la perception robotique en vocabulaire ouvert. À partir d'un flux RGB-D continu, chaque primitive gaussienne reçoit un vecteur de requête compact, converti en embedding de modèle vision-langage (VLM) approximatif via un mécanisme d'attention couplé à un dictionnaire appris en ligne, sans pré-entraînement ni décodeur spécifique à un VLM donné. Pour tenir sur de longues trajectoires, la carte est gérée par hachage de voxels : une zone locale active est optimisée sur GPU, tandis que la carte globale reste stockée et indexée sur CPU afin de borner la mémoire GPU consommée. Sur des benchmarks publics et un jeu de données maison à grande échelle, LatentAM dépasse les méthodes de référence en fidélité de reconstruction des caractéristiques, tout en tournant à une vitesse quasi temps réel de 12 à 35 images par seconde, code et page projet étant déjà publics.
L'enjeu pour l'industrie tient au découplage proposé entre carte sémantique et modèle VLM : la plupart des pipelines existants figent le modèle dès l'entraînement, obligeant à redistiller toute la carte à chaque changement. En rendant cette étape agnostique au modèle et sans pré-entraînement dédié, l'approche permettrait aux intégrateurs de faire évoluer leurs modules de perception, y compris vers de futurs modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sans reconstruire toute la pile cartographique. La vitesse annoncée, jusqu'à 35 images par seconde, vise un traitement embarqué plutôt qu'un post-traitement hors ligne, un point clé pour des robots mobiles ou humanoïdes devant comprendre une scène en temps réel. Il s'agit toutefois d'un résultat évalué sur benchmarks et données internes, pas d'un déploiement en production, la robustesse en environnement industriel non contrôlé restant à démontrer.
LatentAM s'inscrit dans la continuité des travaux récents mêlant Gaussian Splatting et distillation de features VLM pour la cartographie sémantique de scènes, une famille de méthodes qui couplent généralement chaque élément de carte à un modèle précis, au prix d'un réentraînement à chaque mise à jour. En substituant un dictionnaire appris en ligne à un décodeur spécifique, les auteurs cherchent à lever ce verrou tout en maîtrisant l'empreinte mémoire GPU grâce au hachage de voxels. La mention « replace » sur arXiv signale une version révisée d'une soumission antérieure, preuve d'itérations en cours sur la méthode ; code et page projet étant déjà accessibles, la communauté pourra en tester la reproductibilité, mais aucun calendrier d'intégration sur une plateforme robotique commerciale n'est évoqué à ce stade.
Dans nos dossiers




