Aller au contenu principal
GaussLite : cartographie robotique en temps réel par 3D Gaussian Splatting conditionnée par tâche
RecherchearXiv cs.RO 

GaussLite : cartographie robotique en temps réel par 3D Gaussian Splatting conditionnée par tâche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent GaussLite, un système de cartographie 3D par Gaussian Splatting (3DGS) conditionné par la tâche, décrit dans un article publié sur arXiv (arXiv:2606.30809v1). Contrairement aux systèmes 3DGS classiques qui répartissent uniformément leur capacité de représentation sur toute une scène, GaussLite concentre le calcul embarqué sur les zones pertinentes pour une tâche donnée, exprimée en langage naturel comme "se préparer à saisir l'objet sur le bureau". Le système combine un parseur LLM en une passe pour extraire les objets cibles et de référence, un détecteur en vocabulaire ouvert pour les localiser image par image, et une segmentation produisant des masques de pertinence par pixel en temps réel. La densité de semis des gaussiennes, le flux de gradient et la mise à l'échelle sont ensuite alloués selon cette pertinence. À budget de gaussiennes équivalent et en cartographie temps réel à 4 Hz sur du matériel aux ressources limitées, GaussLite surpasse les méthodes de référence de 2,72 dB en moyenne sur le PSNR de la région d'intérêt (ROI) sur le jeu de données Replica, et de 2,23 dB lors de démonstrations sur matériel réel en intérieur et extérieur.

Cette approche répond à un goulot d'étranglement concret pour la robotique embarquée : les plateformes mobiles ou manipulateurs disposent d'une puissance de calcul limitée, et gaspiller des cycles à reconstruire finement des murs ou du mobilier hors sujet pénalise directement la précision là où elle compte, sur l'objet à saisir ou l'obstacle à éviter. En priorisant explicitement la scène par la tâche plutôt que par la géométrie brute, GaussLite s'attaque à un problème récurrent des pipelines de perception pour la manipulation et la navigation autonome : l'écart entre fidélité de reconstruction globale et utilité réelle pour la décision robotique. L'équipe démontre aussi qu'il est possible de fusionner en temps réel les cartes de deux agents spécialisés sur des tâches différentes, via un vote par voxel sur le nombre d'optimisations actives, avec un gain de 3,42 dB par rapport à une simple concaténation, tout en ne partageant que 7,08% de la carte en moyenne, un résultat qui intéresse directement les scénarios multi-robots ou essaims.

GaussLite s'inscrit dans la lignée des travaux récents combinant 3D Gaussian Splatting et robotique, un domaine en forte expansion depuis l'adoption de cette technique de rendu comme alternative aux NeRF pour la cartographie en temps réel. La contribution se distingue des systèmes 3DGS génériques en intégrant directement un module de compréhension du langage et de détection ouverte pour piloter l'allocation de ressources, plutôt que de traiter la sémantique comme une étape séparée en aval. Les auteurs ne précisent pas de plan de déploiement industriel ni de partenariat commercial ; il s'agit à ce stade d'un travail de recherche évalué sur Replica et sur un banc de test matériel propre à l'équipe, sans comparaison publiée face à des architectures commerciales de cartographie temps réel.

Dans nos dossiers

À lire aussi

VLEM : cartographie 3D vision-langage par embeddings en temps réel
1arXiv cs.RO 

VLEM : cartographie 3D vision-langage par embeddings en temps réel

Une équipe de chercheurs a publié une version révisée (v2) de l'article arXiv 2508.06291 présentant VLEM (Vision-Language Embedding Mapping), un système de cartographie sémantique 3D en temps réel qui fonctionne à partir d'un simple flux RGB-D brut, sans poses de caméra vérité terrain. Le framework fusionne des embeddings vision-langage 2D alignés au pixel, issus de différents modèles vision-langage, dans une représentation 3D globalement cohérente et métriquement précise. Comparé à trois systèmes existants, ConceptFusion, Open-Fusion et RayFronts, VLEM affiche de meilleures performances en segmentation en vocabulaire ouvert et une représentation plus compacte en mémoire. Les auteurs démontrent aussi son usage sur des tâches de manipulation robotique interactive en temps réel et sur des scénarios de cartographie mobile. La compréhension sémantique de scène en robotique exige des représentations à la fois précises au sens métrique et interrogeables en langage naturel en temps réel, combinaison que les modèles vision-langage peinent à tenir une fois intégrés à un pipeline 3D, freinés par le coût de calcul, les contraintes mémoire et la dépendance habituelle à des poses caméra vérité terrain rarement disponibles hors laboratoire. En s'appuyant uniquement sur un flux RGB-D brut, VLEM lève ce verrou et rapproche cette cartographie sémantique d'un déploiement robotique réel, hors environnement instrumenté. Pour les équipes de recherche en manipulation ou en navigation mobile, cela ouvre la voie à des robots interrogeables en langage naturel directement sur une carte 3D construite à la volée. La comparaison à ConceptFusion, Open-Fusion et RayFronts reste un benchmark choisi par les auteurs, à confirmer par des évaluations indépendantes. VLEM s'inscrit dans la lignée des travaux combinant modèles vision-langage type CLIP et pipelines de SLAM pour doter les robots d'une compréhension du monde interrogeable en langage naturel, citant explicitement ConceptFusion, Open-Fusion et RayFronts comme repères directs plutôt qu'une rupture inédite. Il s'agit à ce stade d'une publication de recherche en preprint sur arXiv, sans produit, partenariat industriel ni calendrier de déploiement annoncés ; la mention "replace" signale une révision d'une soumission initiale. La suite attendue pour ce type de travail est la publication du code et une évaluation communautaire sur des jeux de données standardisés, avant une éventuelle reprise par des acteurs commerciaux de la robotique.

RecherchePaper
1 source
LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne
2arXiv cs.RO 

LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne

Une équipe de recherche a publié une version révisée de l'article LatentAM sur arXiv (référence 2602.12314), qui présente un système de cartographie 3D par Gaussian Splatting en ligne destiné à la perception robotique en vocabulaire ouvert. À partir d'un flux RGB-D continu, chaque primitive gaussienne reçoit un vecteur de requête compact, converti en embedding de modèle vision-langage (VLM) approximatif via un mécanisme d'attention couplé à un dictionnaire appris en ligne, sans pré-entraînement ni décodeur spécifique à un VLM donné. Pour tenir sur de longues trajectoires, la carte est gérée par hachage de voxels : une zone locale active est optimisée sur GPU, tandis que la carte globale reste stockée et indexée sur CPU afin de borner la mémoire GPU consommée. Sur des benchmarks publics et un jeu de données maison à grande échelle, LatentAM dépasse les méthodes de référence en fidélité de reconstruction des caractéristiques, tout en tournant à une vitesse quasi temps réel de 12 à 35 images par seconde, code et page projet étant déjà publics. L'enjeu pour l'industrie tient au découplage proposé entre carte sémantique et modèle VLM : la plupart des pipelines existants figent le modèle dès l'entraînement, obligeant à redistiller toute la carte à chaque changement. En rendant cette étape agnostique au modèle et sans pré-entraînement dédié, l'approche permettrait aux intégrateurs de faire évoluer leurs modules de perception, y compris vers de futurs modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sans reconstruire toute la pile cartographique. La vitesse annoncée, jusqu'à 35 images par seconde, vise un traitement embarqué plutôt qu'un post-traitement hors ligne, un point clé pour des robots mobiles ou humanoïdes devant comprendre une scène en temps réel. Il s'agit toutefois d'un résultat évalué sur benchmarks et données internes, pas d'un déploiement en production, la robustesse en environnement industriel non contrôlé restant à démontrer. LatentAM s'inscrit dans la continuité des travaux récents mêlant Gaussian Splatting et distillation de features VLM pour la cartographie sémantique de scènes, une famille de méthodes qui couplent généralement chaque élément de carte à un modèle précis, au prix d'un réentraînement à chaque mise à jour. En substituant un dictionnaire appris en ligne à un décodeur spécifique, les auteurs cherchent à lever ce verrou tout en maîtrisant l'empreinte mémoire GPU grâce au hachage de voxels. La mention « replace » sur arXiv signale une version révisée d'une soumission antérieure, preuve d'itérations en cours sur la méthode ; code et page projet étant déjà accessibles, la communauté pourra en tester la reproductibilité, mais aucun calendrier d'intégration sur une plateforme robotique commerciale n'est évoqué à ce stade.

RecherchePaper
1 source
FutureRTC : exécution robotique en temps réel par regroupement d'actions conditionné par anticipation
3arXiv cs.RO 

FutureRTC : exécution robotique en temps réel par regroupement d'actions conditionné par anticipation

Des chercheurs présentent FutureRTC, un framework destiné à corriger un problème concret du déploiement temps réel des politiques Vision-Language-Action (VLA) sur robots : lorsque l'exécution est asynchrone, c'est-à-dire que le prochain bloc d'actions (« chunk ») est calculé pendant que le bloc courant s'exécute encore, un décalage apparaît entre ce qui a été prédit et ce qui se passe réellement, provoquant des discontinuités visibles aux frontières entre chunks. Contrairement aux approches existantes qui lissent superficiellement ces transitions, réentraînent coûteusement la politique, ou ne prédisent que les états proprioceptifs sans tenir compte des observations visuelles, FutureRTC s'installe en complément d'une politique VLA existante sans la modifier. Le système combine un module de correction d'état, qui compense l'écart entre les états proprioceptifs projetés en avance et ceux réellement observés à l'exécution, et un module de prédiction d'observation, qui anticipe les représentations visuelles au moment de l'exécution en utilisant le mouvement du robot comme a priori physique via un transport et une reconstruction de caractéristiques conditionnés par ce mouvement. Une fonction de perte de cohérence aligne enfin les chunks d'actions générés à partir de ces contextes prédits avec ceux que produirait la politique si elle recevait directement les entrées réelles. Ce travail cible un angle mort fréquent des démonstrations de VLA : la plupart des résultats publiés minimisent la latence d'inférence, un scénario éloigné des contraintes réelles d'un robot où le calcul d'un nouveau chunk prend un temps non négligeable pendant lequel le bras ou l'humanoïde continue de bouger. En corrigeant ce décalage sans réentraîner la politique, FutureRTC s'attaque directement à l'écart entre démonstration en laboratoire et déploiement industriel, un enjeu central pour les intégrateurs qui font tourner des politiques VLA génériques sur du matériel aux contraintes de latence variables. Les auteurs rapportent des trajectoires plus lisses, une exécution plus rapide et de meilleurs taux de succès face aux délais d'inférence, en simulation comme sur robot réel, sans toutefois publier de chiffres détaillés dans le résumé. Le papier s'inscrit dans la recherche actuelle sur les politiques VLA généralistes, dans la lignée de modèles comme Pi-0 ou GR00T N2, où la latence d'inférence devient critique à mesure que ces modèles grossissent. Publié sur arXiv comme nouvelle soumission, sans partenariat industriel ni calendrier de déploiement mentionné, il reste pour l'instant un résultat académique dont la portée pratique dépendra de sa reproduction sur des plateformes robotiques tierces.

RechercheActu
1 source
GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon
4arXiv cs.RO 

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon

Un article de recherche publie sur arXiv le 18 aout 2026 (référence 2608.14986v1) présente GaussMemory, un système de mémoire spatiale pour la manipulation robotique a long horizon, construit sur le 3D Gaussian Splatting comme substrat géométrique persistant. A la différence des mémoires 3D existantes, qui enregistrent les observations selon des règles fixes en traitant chaque élément de la scene avec la même importance, GaussMemory apprend de bout en bout quels objets suivre précisément, a quelle fréquence les mettre a jour et quoi oublier. Sur les bancs d'essai LIBERO et VLABench, il depasse le système MemoryVLA sur les taches Goal et Long-10, et surpasse le modèle π0-FAST de 5,2 points sur la piste 1 et de 6,0 points sur la piste 6. Le problème vise est bien connu du secteur: les architectures vision-langage-action mémorisent généralement l'environnement de façon passive, sans distinguer ce qui compte pour la tache en cours, ce qui dégradé les performances des que les séquences de manipulation s'allongent. En unifiant mise a jour et lecture de la mémoire dans un seul mécanisme appris plutôt que des heuristiques écrites a la main, GaussMemory s'inscrit dans une tendance de fond visant a faire passer les VLA de démonstrations courtes en laboratoire vers des taches multi-étapes plus proches des besoins industriels réels. Pour les intégrateurs qui évaluent des piles VLA, des gains chiffres sur des benchmarks standardises comme LIBERO et VLABench offrent un point de comparaison plus solide qu'une simple vidéo de démonstration. Le travail se positionne explicitement face a deux références du domaine, MemoryVLA et π0-FAST, ce dernier dérivé du modèle π0 de Physical Intelligence, citées comme bases de comparaison directes plutôt que comme simples antécédents. Il s'inscrit dans la lignée des travaux sur le 3D Gaussian Splatting, technique de représentation de scènes issue de la vision par ordinateur, de plus en plus réutilisée comme mémoire de travail pour des agents robotiques. A ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation, sans déploiement matériel annonce ni partenaire industriel cite, et sans calendrier donne pour un transfert vers des robots physiques, ce qui distingue clairement cette contribution d'une annonce produit ou d'un pilote commercial.

RechercheActu
1 source