Aller au contenu principal
RecherchearXiv cs.RO 

TRACE : sélection privée de la meilleure prochaine vue sur des cartes 3D en Gaussian Splatting distribuées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.00822) TRACE, un protocole qui permet à une équipe de robots de choisir leur prochaine vue d'observation sans jamais partager leurs cartes. Chaque robot construit sa propre carte 3D en Gaussian Splatting (3DGS) et la garde privée. Il sélectionne la vue au gain d'information attendu (EIG) maximal sur les gaussiennes de son propre trajet. Or ce gain dépend des cartes des autres : leurs gaussiennes occultent les siennes ou rayonnent derrière elles, de sorte que l'EIG doit être évalué sur la carte agrégée, qu'aucun robot ne possède. Les auteurs montrent que ce couplage ne passe que par deux quantités le long des rayons, la transmittance devant une gaussienne et la radiance derrière elle, toutes deux sommes sur les impacts du rayon. Chaque robot calcule donc ces sommes par intervalles de profondeur dans sa carte, le long des rayons de la vue candidate, et envoie ces agrégats avec leurs dérivées de pose. Le robot planificateur en déduit l'EIG et son gradient sur SO(3). Sur 100 décisions dans Habitat-Sim, TRACE choisit un cap à moins de 15 degrés de la solution centralisée dans 83,3 % des cas, et les vues retenues atteignent 97,9 % de l'EIG centralisé.

L'intérêt tient à la taille des messages, qui ne croît pas avec celle des cartes. Aucune gaussienne n'est transmise : la confidentialité vient de la structure du problème, pas d'un chiffrement ajouté. Pour l'exploration multi-robots, c'est une voie pour coopérer sans exposer la géométrie ni l'apparence d'un site, ce qui compte pour des flottes inter-entreprises ou des environnements sensibles (usines, sites logistiques, infrastructures). Les auteurs prouvent que la reconstruction est exacte, sauf lorsqu'un intervalle de profondeur situé derrière une gaussienne mêle des impacts de deux robots, et ils bornent l'erreur dans ce cas. Les chiffres appellent toutefois de la prudence : 83,3 % de caps proches signifie qu'une décision sur six s'écarte de plus de 15 degrés, et les résultats viennent de la simulation seule. Rien ne dit encore comment le protocole tient face au bruit de localisation, aux latences réseau ou à des cartes réelles.

Le travail s'inscrit dans la montée du 3DGS comme représentation de carte pour la robotique, en alternative aux grilles d'occupation et aux NeRF, et dans la littérature sur la sélection de la meilleure prochaine vue (next-best-view) et l'exploration active. Il s'agit d'une préprint v1, sans code ni déploiement annoncés dans le résumé, et d'une démonstration de principe, pas d'un produit. Les suites logiques seraient une validation sur robots physiques, avec plus de deux ou trois agents, et une analyse des fuites d'information résiduelles dans les agrégats échangés. Aucun acteur européen n'est cité dans le résumé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Contrôle de sécurité : navigation vers vue optimale sans collision dans des cartes en Gaussian Splatting 3D
1arXiv cs.RO 

Contrôle de sécurité : navigation vers vue optimale sans collision dans des cartes en Gaussian Splatting 3D

Splat-CBF, une méthode de contrôle publiée sur arXiv (2609.23100, soumis en septembre 2026), s'attaque à un problème classique de la navigation robotique en environnement non cartographié : où regarder et comment se déplacer en même temps, sachant que les zones les plus intéressantes à observer sont aussi celles où le robot maîtrise le moins ses marges de sécurité. La méthode combine deux fonctions barrières de contrôle (control barrier functions, CBF) dans un seul programme quadratique. La première impose la sécurité comme contrainte dure, en convertissant l'Average Value-at-Risk du champ de gaussiennes 3D (Gaussian Splatting) de la carte en une contrainte lisse et unique. La seconde encourage, en contrainte souple, les orientations de caméra qui maximisent le gain d'information de Fisher attendu le long de la trajectoire planifiée, une approche dite de "next-best-view". Une pénalité de relâchement s'ajuste dynamiquement selon la fréquence à laquelle la contrainte de perception a déjà été assouplie et la proximité d'une zone incertaine. Les auteurs valident l'approche en simulation intérieure, sur un bras manipulateur Kinova dans Isaac Sim, et sur un robot mobile à direction Ackermann en conditions réelles. Les résultats indiquent une navigation plus rapide, une collecte d'informations accrue et un temps de calcul en ligne réduit par rapport à des approches de référence limitées soit à la sécurité seule, soit à la perception seule, le robot ne renonçant à un mouvement informatif que lorsque la sécurité l'exige. L'intérêt pour les intégrateurs et roboticiens tient à la démonstration qu'exploration active et garanties de sécurité formelles peuvent être unifiées dans une seule optimisation temps réel plutôt que traitées en pipelines séquentiels, un enjeu direct pour les AMR d'entrepôt, les robots d'inspection ou les manipulateurs opérant dans des environnements inconnus ou changeants où attendre une cartographie complète avant de bouger n'est pas viable. Le travail s'inscrit dans l'adoption croissante du Gaussian Splatting, initialement une technique de rendu graphique, comme représentation de carte différentiable et photoréaliste pour la robotique, en alternative aux nuages de points ou aux champs de radiance neuronaux, avec l'avantage de fournir des estimations d'incertitude exploitables analytiquement. Il s'agit d'une contribution de recherche, testée à petite échelle sur un seul bras et un seul robot roulant, sans annonce de déploiement industriel ni de partenaire commercial ; les suites logiques évoquées par les auteurs porteraient sur des environnements dynamiques plus complexes ou des scénarios multi-robots.

RecherchePaper
1 source
SemSafe-3DGS : navigation active tenant compte du risque sémantique dans des cartes 3D Gaussian Splatting incertaines
2arXiv cs.RO 

SemSafe-3DGS : navigation active tenant compte du risque sémantique dans des cartes 3D Gaussian Splatting incertaines

Une équipe de recherche publie sur arXiv (identifiant 2609.19330v1) un nouveau framework baptisé SemSafe-3DGS, destiné à la navigation active et sécurisée de robots autonomes dans des environnements partiellement observés. Le système s'appuie sur des cartes 3D construites par Gaussian Splatting, une technique de reconstruction de scène par primitives gaussiennes, auxquelles sont associés des attributs sémantiques. Chaque primitive gaussienne reçoit un poids de risque dépendant de sa classe sémantique, intégré dans un modèle de distance de collision basé sur l'Average Value-at-Risk. Ces distances pondérées alimentent une fonction de barrière de contrôle (control barrier function, CBF), combinée à une seconde barrière dite de perception active qui pousse le robot à recueillir des observations réduisant l'incertitude géométrique de la carte le long de sa trajectoire prévue. Les deux objectifs sont fusionnés dans un unique programme quadratique sous contrainte CBF-QP, qui impose l'évitement de collision comme contrainte dure tout en assouplissant l'acquisition d'information lorsqu'elle entre en conflit avec la sécurité. Les auteurs rapportent des expériences validant l'efficacité de la contrainte de sécurité, une navigation améliorée grâce à la perception active, une adaptation de trajectoire dépendante de la sémantique, ainsi qu'une exécution sur robot réel à dynamique de type Ackermann. L'intérêt pour l'industrie robotique tient au constat de départ : les formulations de sécurité existantes raisonnent presque exclusivement sur la géométrie, traitant de façon identique des obstacles géométriquement similaires mais sémantiquement très différents, par exemple un mur et une personne. En intégrant la sémantique directement dans la fonction de barrière plutôt qu'en aval, l'approche vise une prise de décision plus fine pour les robots mobiles opérant en environnement humain ou industriel partiellement cartographié, un enjeu direct pour les intégrateurs d'AMR et de plateformes de navigation autonome. Ce travail s'inscrit dans la lignée des méthodes de contrôle sûr par CBF-QP, désormais couplées aux représentations de scène par Gaussian Splatting qui gagnent du terrain face aux cartes d'occupation classiques pour leur richesse géométrique et photométrique. Il s'agit d'une publication de recherche en preprint, sans annonce de produit ni de partenariat industriel ; les prochaines étapes concerneraient une validation sur davantage de plateformes robotiques et de scénarios sémantiques.

RecherchePaper
1 source
Perception active et contrôle tenant compte des conflits dans les champs de Gaussian Splatting 3D via des fonctions barrière de contrôle
3arXiv cs.RO 

Perception active et contrôle tenant compte des conflits dans les champs de Gaussian Splatting 3D via des fonctions barrière de contrôle

Des chercheurs ont publié sur arXiv (référence 2605.20566) un cadre algorithmique baptisé "conflict-aware active perception and control" pour robots évoluant dans des environnements modélisés par 3D Gaussian Splatting (3DGS). L'approche repose sur un programme quadratique unifié qui traite simultanément deux objectifs antagonistes : la sécurité, imposée comme contrainte dure via une Control Barrier Function (CBF), et l'acquisition d'information, traitée comme contrainte souple assouplie par des variables de relâchement (slack variables). La CBF est dérivée d'une métrique de risque de collision dite Average Value-at-Risk (AV@R), qui intègre l'incertitude géométrique de la carte et garantit mathématiquement l'invariance avant d'un ensemble sûr. Pour maximiser la perception, le système sélectionne la prochaine meilleure vue (next-best-view) via une formulation risk-aware de l'Expected Information Gain (EIG), et oriente la caméra vers la direction de montée d'information locale grâce à des "perception barrier functions". Les résultats présentés sont issus de simulations uniquement, sans validation sur plateforme physique. Le problème central que ce travail adresse est structurel : dans un environnement partiellement inconnu, les vues les plus informatives se trouvent précisément dans les zones les moins cartographiées, donc les plus à risque de collision. Les approches existantes basées sur 3DGS traitaient ces deux objectifs séparément ou par simple pondération, sans garanties formelles. Formuler la sécurité comme contrainte inviolable tout en relaxant la perception permet aux décideurs B2B et aux intégrateurs robotiques d'envisager des robots d'exploration actifs qui cartographient des environnements industriels non balisés sans compromis ad hoc entre productivité et sécurité. L'amélioration simultanée de la sécurité et du gain d'information, comparée aux méthodes 3DGS concurrentes, constitue un signal technique intéressant, même si l'absence d'expériences réelles limite pour l'instant la portée de la validation. Le 3DGS s'est imposé comme représentation de référence pour les champs de radiance neuronaux depuis 2023, supplantant progressivement le NeRF grâce à sa vitesse de rendu et sa différentiabilité. Les CBF sont un outil établi en commande sûre, mais leur intégration dans des champs neuronaux pour la perception active reste un axe de recherche émergent. Aucune institution ni entreprise n'est explicitement nommée dans l'abstract, et aucun déploiement industriel n'est annoncé. Les concurrents directs sont les méthodes d'exploration active basées NeRF et les planificateurs next-best-view classiques. Les prochaines étapes naturelles seraient une validation sim-to-real sur plateforme physique et des tests dans des scènes plus complexes.

RecherchePaper
1 source
VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique
4arXiv cs.RO 

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique

VistaVLA, présenté dans un article arXiv publié le 15 juillet 2026, est un nouveau framework de manipulation robotique combinant vision, langage et action (VLA) qui construit une représentation 3D explicite de la scène à partir de primitives de Gaussiennes 3D. Contrairement aux modèles VLA classiques qui projettent directement instructions textuelles et images 2D vers des actions, VistaVLA fonctionne en deux étapes : il élève des caractéristiques vision-langage multi-vues en primitives gaussiennes 3D, créant des tokens sémantiques ancrés géométriquement, puis les compresse via un mécanisme baptisé Merge-then-Query (MtQ). Ce module réduit de 99% le nombre de tokens nécessaires tout en préservant les informations spatiales et sémantiques utiles à l'action. Les auteurs rapportent des gains de 22,8% du taux de réussite sur sept tâches réelles, et de 30% par rapport à la baseline VLA-Adapter sur des tâches hors distribution (out-of-distribution), en environnement simulé comme réel. Pour l'industrie robotique, ce travail cible un point faible connu des modèles VLA actuels : leur absence de représentation 3D persistante et invariante au point de vue, qui limite leur capacité à raisonner sur des contraintes géométriques et des layouts spatiaux complexes. La plupart des VLA en production s'appuient sur des flux caméra 2D bruts ou des cartes de profondeur peu structurées ; VistaVLA propose une carte cognitive 3D sémantique inspirée de la cognition humaine, un argument qui, s'il se confirme à plus grande échelle, pourrait influencer la conception des prochaines générations de politiques d'action pour bras manipulateurs et robots mobiles. Ce travail s'inscrit dans une vague de recherche académique cherchant à combler l'écart entre modèles VLA à succès commercial, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, et leurs limites documentées en generalisation spatiale. Les résultats restent pour l'instant issus d'évaluations contrôlées en laboratoire, sans déploiement industriel annoncé ; la validation sur des tâches de manipulation plus variées et à plus grande échelle reste la prochaine étape naturelle pour ce type d'approche.

RechercheActu
1 source