Aller au contenu principal
LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne
RecherchearXiv cs.RO 

LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié une version révisée de l'article LatentAM sur arXiv (référence 2602.12314), qui présente un système de cartographie 3D par Gaussian Splatting en ligne destiné à la perception robotique en vocabulaire ouvert. À partir d'un flux RGB-D continu, chaque primitive gaussienne reçoit un vecteur de requête compact, converti en embedding de modèle vision-langage (VLM) approximatif via un mécanisme d'attention couplé à un dictionnaire appris en ligne, sans pré-entraînement ni décodeur spécifique à un VLM donné. Pour tenir sur de longues trajectoires, la carte est gérée par hachage de voxels : une zone locale active est optimisée sur GPU, tandis que la carte globale reste stockée et indexée sur CPU afin de borner la mémoire GPU consommée. Sur des benchmarks publics et un jeu de données maison à grande échelle, LatentAM dépasse les méthodes de référence en fidélité de reconstruction des caractéristiques, tout en tournant à une vitesse quasi temps réel de 12 à 35 images par seconde, code et page projet étant déjà publics.

L'enjeu pour l'industrie tient au découplage proposé entre carte sémantique et modèle VLM : la plupart des pipelines existants figent le modèle dès l'entraînement, obligeant à redistiller toute la carte à chaque changement. En rendant cette étape agnostique au modèle et sans pré-entraînement dédié, l'approche permettrait aux intégrateurs de faire évoluer leurs modules de perception, y compris vers de futurs modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sans reconstruire toute la pile cartographique. La vitesse annoncée, jusqu'à 35 images par seconde, vise un traitement embarqué plutôt qu'un post-traitement hors ligne, un point clé pour des robots mobiles ou humanoïdes devant comprendre une scène en temps réel. Il s'agit toutefois d'un résultat évalué sur benchmarks et données internes, pas d'un déploiement en production, la robustesse en environnement industriel non contrôlé restant à démontrer.

LatentAM s'inscrit dans la continuité des travaux récents mêlant Gaussian Splatting et distillation de features VLM pour la cartographie sémantique de scènes, une famille de méthodes qui couplent généralement chaque élément de carte à un modèle précis, au prix d'un réentraînement à chaque mise à jour. En substituant un dictionnaire appris en ligne à un décodeur spécifique, les auteurs cherchent à lever ce verrou tout en maîtrisant l'empreinte mémoire GPU grâce au hachage de voxels. La mention « replace » sur arXiv signale une version révisée d'une soumission antérieure, preuve d'itérations en cours sur la méthode ; code et page projet étant déjà accessibles, la communauté pourra en tester la reproductibilité, mais aucun calendrier d'intégration sur une plateforme robotique commerciale n'est évoqué à ce stade.

À lire aussi

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure
1arXiv cs.RO 

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure

Des chercheurs ont publié en mai 2026 (arXiv:2605.17661) Mono-Hydra++, un pipeline temps réel capable de construire des graphes de scène 3D hiérarchiques d'intérieurs en n'utilisant qu'une caméra RGB monoculaire et une IMU, sans capteur de profondeur actif. Le coeur du système repose sur M2H-MX, un modèle multi-tâches fondé sur DINOv3 qui estime simultanément la profondeur et la sémantique des images. Ces estimations alimentent un front-end d'odométrie visuelle-inertielle (VIO) enrichi de contraintes de profondeur prédites creuses, d'un masquage sémantique des zones dynamiques et d'un alignement temporel tenant compte de la pose, avant fusion volumétrique dans le backend Mono-Hydra. Sur le sous-ensemble d'évaluation Go-SLAM/ScanNet, le système affiche 1,6 % d'erreur de trajectoire en moins que le meilleur baseline RGB-D testé ; sur le benchmark calibré 7-Scenes, il réduit l'ATE moyen de 29,8 % par rapport au meilleur concurrent calibré. Le modèle de perception M2H-MX-L, exporté en ONNX/TensorRT FP16, tourne à 25,53 FPS sur un Jetson Orin NX 16 Go, et le pipeline a été validé dans un déploiement réel dans un bâtiment ITC avec une caméra RealSense RGB + IMU. L'impact industriel est direct pour les plateformes à contraintes sévères : drones d'inspection, robots humanoïdes légers et AMR embarquant peu de puissance. Jusqu'ici, la construction de graphes de scène 3D, qui organisent l'espace en objets, pièces et relations spatiales, nécessitait des capteurs actifs (RGB-D ou LiDAR) impraticables dès que le payload ou la consommation électrique sont limités. Mono-Hydra++ démontre qu'il est possible d'atteindre, voire de dépasser, la précision de ces baselines lourds avec une seule caméra et une IMU bas coût. Pour un intégrateur ou un COO industriel, cela signifie une réduction substantielle du coût matériel embarqué et l'ouverture de cas d'usage où le RGB-D n'est pas envisageable. Il convient toutefois de noter que les résultats sont issus de benchmarks académiques standardisés : la robustesse sur des scènes industrielles non contrôlées, avec éclairages difficiles ou textures répétitives, reste à confirmer dans des conditions opérationnelles réelles. Mono-Hydra++ s'inscrit dans la lignée du système Hydra du MIT, qui a posé les bases de la représentation hiérarchique en graphe de scène pour la robotique. L'utilisation de DINOv3 comme backbone de vision fondationnelle est cohérente avec la tendance forte à extraire simultanément géométrie et sémantique depuis des modèles pré-entraînés à grande échelle. Sur ce terrain, les concurrents directs incluent les systèmes basés sur RGB-D comme Go-SLAM, iMAP ou NICE-SLAM, ainsi que des approches VIO-sémantiques récentes, mais peu proposent la combinaison complète cartographie métrique, sémantique et graphe de scène en temps réel sur matériel embarqué contraint. En tant que preprint arXiv non encore évalué par les pairs, les prochaines étapes attendues sont la publication en conférence (IROS, ICRA), des tests sur plateformes aériennes effectives et une éventuelle intégration dans des stacks robotiques open-source comme ROS 2.

UELes constructeurs européens d'AMR légers et de drones d'inspection pourraient à terme réduire leurs coûts matériels embarqués en remplaçant les capteurs RGB-D par une caméra monoculaire, sous réserve de validation dans des conditions industrielles non contrôlées.

RecherchePaper
1 source
Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile
2arXiv cs.RO 

Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile

Des chercheurs publient SBP (Seeing the Bigger Picture), une méthode d'apprentissage de politiques pour la manipulation mobile fondée sur une carte 3D de caractéristiques latentes plutôt que sur de simples images, documentée sur arXiv sous la référence 2510.03885 en quatrième version. La méthode fusionne de manière incrémentale des observations multi-vues dans une grille de caractéristiques propre à chaque scène ; un décodeur pré-entraîné reconstruit des embeddings cibles à partir de ces caractéristiques, permettant d'optimiser la carte en ligne pendant l'exécution de la tâche. La politique, entraînable par clonage comportemental ou apprentissage par renforcement, traite cette carte comme variable d'état. Sur une tâche de manipulation séquentielle sur table, SBP améliore le taux de réussite de 15 % par rapport à une politique fondée uniquement sur des images, dans des scènes déjà vues comme inédites. Ce résultat cible une limite connue des politiques de type VLA (vision-language-action), qui raisonnent généralement image par image et perdent toute mémoire de ce qui sort du champ de la caméra. Pour un robot mobile devant se souvenir d'un objet vu dans une autre pièce ou enchaîner des sous-tâches dans la durée, cette absence de mémoire spatiale persistante est un frein concret. En montrant qu'une représentation 3D explicite et réoptimisable en continu surpasse une politique purement image-vers-action, l'étude suggère que le raisonnement spatial long-terme ne se résoudra pas seulement en augmentant modèles et données : la structure de la représentation d'état compte, un signal utile pour les intégrateurs de robots mobiles et humanoïdes. Ce travail s'inscrit dans une recherche plus large combinant cartographie 3D (voxels, champs de caractéristiques, représentations type NeRF) et apprentissage de politiques, en alternative aux approches VLA tout-image qui dominent les annonces du secteur. Le résumé ne précise ni institution ni plateforme robotique commerciale associée : il s'agit d'une contribution académique publiée sur arXiv, déjà révisée au moins quatre fois, signe d'un travail encore en affinement plutôt que d'un produit fini. Aucune date de déploiement ni partenariat industriel n'est mentionné ; la portée reste celle d'une preuve de concept en laboratoire, sans indication de transfert vers un robot physique déployé à grande échelle.

RecherchePaper
1 source
GaussLite : cartographie robotique en temps réel par 3D Gaussian Splatting conditionnée par tâche
3arXiv cs.RO 

GaussLite : cartographie robotique en temps réel par 3D Gaussian Splatting conditionnée par tâche

Des chercheurs présentent GaussLite, un système de cartographie 3D par Gaussian Splatting (3DGS) conditionné par la tâche, décrit dans un article publié sur arXiv (arXiv:2606.30809v1). Contrairement aux systèmes 3DGS classiques qui répartissent uniformément leur capacité de représentation sur toute une scène, GaussLite concentre le calcul embarqué sur les zones pertinentes pour une tâche donnée, exprimée en langage naturel comme "se préparer à saisir l'objet sur le bureau". Le système combine un parseur LLM en une passe pour extraire les objets cibles et de référence, un détecteur en vocabulaire ouvert pour les localiser image par image, et une segmentation produisant des masques de pertinence par pixel en temps réel. La densité de semis des gaussiennes, le flux de gradient et la mise à l'échelle sont ensuite alloués selon cette pertinence. À budget de gaussiennes équivalent et en cartographie temps réel à 4 Hz sur du matériel aux ressources limitées, GaussLite surpasse les méthodes de référence de 2,72 dB en moyenne sur le PSNR de la région d'intérêt (ROI) sur le jeu de données Replica, et de 2,23 dB lors de démonstrations sur matériel réel en intérieur et extérieur. Cette approche répond à un goulot d'étranglement concret pour la robotique embarquée : les plateformes mobiles ou manipulateurs disposent d'une puissance de calcul limitée, et gaspiller des cycles à reconstruire finement des murs ou du mobilier hors sujet pénalise directement la précision là où elle compte, sur l'objet à saisir ou l'obstacle à éviter. En priorisant explicitement la scène par la tâche plutôt que par la géométrie brute, GaussLite s'attaque à un problème récurrent des pipelines de perception pour la manipulation et la navigation autonome : l'écart entre fidélité de reconstruction globale et utilité réelle pour la décision robotique. L'équipe démontre aussi qu'il est possible de fusionner en temps réel les cartes de deux agents spécialisés sur des tâches différentes, via un vote par voxel sur le nombre d'optimisations actives, avec un gain de 3,42 dB par rapport à une simple concaténation, tout en ne partageant que 7,08% de la carte en moyenne, un résultat qui intéresse directement les scénarios multi-robots ou essaims. GaussLite s'inscrit dans la lignée des travaux récents combinant 3D Gaussian Splatting et robotique, un domaine en forte expansion depuis l'adoption de cette technique de rendu comme alternative aux NeRF pour la cartographie en temps réel. La contribution se distingue des systèmes 3DGS génériques en intégrant directement un module de compréhension du langage et de détection ouverte pour piloter l'allocation de ressources, plutôt que de traiter la sémantique comme une étape séparée en aval. Les auteurs ne précisent pas de plan de déploiement industriel ni de partenariat commercial ; il s'agit à ce stade d'un travail de recherche évalué sur Replica et sur un banc de test matériel propre à l'équipe, sans comparaison publiée face à des architectures commerciales de cartographie temps réel.

RecherchePaper
1 source
Apprentissage rapide de l'écriture manuscrite dextérique par estimation jacobienne en temps réel
4arXiv cs.RO 

Apprentissage rapide de l'écriture manuscrite dextérique par estimation jacobienne en temps réel

Une équipe de recherche a publié le 11 septembre 2026 sur arXiv (référence 2609.11775) un contrôleur permettant à une main robotique anthropomorphe d'écrire avec un stylo tenu en main, sans simulation ni démonstrations préenregistrées. La méthode repose sur une estimation en temps réel du jacobien de la tâche pour l'ensemble main-objet, calculée directement sur le robot physique et fonctionnant uniquement sur le processeur d'un ordinateur portable. Le contrôleur commence à écrire après environ 18 secondes d'initialisation et continue de s'adapter en continu, sans modèle cinématique ou de contact préétabli. Testée sur trois mains anthropomorphes, une physique et deux simulées, la formulation atteint sur le robot physique une précision moyenne de 0,6 millimètre dans le plan, pour des lettres et des formes tracées en l'air et sur papier. Cette démonstration s'attaque à un problème non résolu de la robotique humanoïde: la manipulation dextre in-hand d'un objet saisi. Les approches dominantes, apprentissage par renforcement en simulation et apprentissage par imitation à partir de démonstrations humaines, butent sur les limites des simulateurs actuels face à la richesse des contacts main-objet et sur le coût de collecte de démonstrations dextres. En s'affranchissant de ces contraintes via un contrôleur analytique adaptatif, les auteurs proposent une alternative légère en calcul et en données, transposable d'une main à une autre sans réentraînement complet, un enjeu concret pour les intégrateurs cherchant à équiper des mains dextres sans les cycles de développement lourds du RL ou de l'IL. Le papier revendique la première démonstration d'une main anthropomorphe traçant des trajectoires arbitraires à trait unique avec un stylo saisi par mouvement purement intra-main, une affirmation encore à valider, puisqu'il s'agit d'une prépublication arXiv non relue par des pairs. Le travail se positionne comme une alternative aux architectures vision-langage-action et aux pipelines RL/IL utilisés par les laboratoires de manipulation dextre humanoïde. Aucun partenaire industriel, financement ni date de déploiement commercial n'est mentionné: il s'agit d'une preuve de concept technique, pas d'un produit prêt à l'emploi. Les suites attendues portent sur l'extension à des tâches plus complexes que l'écriture et sur la robustesse de l'estimateur face à des objets de forme et de masse variables.

RecherchePaper
1 source