Aller au contenu principal
ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles
RecherchearXiv cs.RO 

ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent dans un preprint arXiv (référence 2602.11575, troisième version) un pipeline baptisé ReaDy-Go qui vise à combler l'écart simulation-réalité pour la navigation visuelle robotique en environnements dynamiques. Le principe : reconstruire une scène réelle cible (domicile, restaurant, usine) sous forme de nuage de gaussiennes 3D (Gaussian Splatting, ou GS), puis y insérer des avatars humains animables, eux aussi représentés en GS photoreáliste, dont les mouvements sont synthétisés à partir de trajectoires 2D. Un planificateur expert dédié aux représentations GS dynamiques, couplé à un planificateur humain, génère ensuite automatiquement des milliers de scénarios de navigation depuis des points de vue arbitraires. Les politiques de navigation entraînées sur ces datasets sont ensuite déployées sur robot physique. Les auteurs rapportent des gains de performance en simulation et en conditions réelles face à des obstacles mobiles, ainsi qu'un transfert zero-shot dans un environnement inédit, ce qui suggère une capacité de généralisation au-delà des scènes d'entraînement.

L'enjeu industriel est significatif pour les intégrateurs de robots de service et les concepteurs de systèmes AMR (autonomous mobile robots) en environnements non contrôlés. Le verrou principal que ReaDy-Go cherche à lever est double : les méthodes classiques souffrent d'un sim-to-real gap important parce que les scènes d'entraînement sont génériques, et les obstacles dynamiques y sont soit absents, soit représentés par des mannequins non photoréalistes issus de simulateurs comme Isaac Sim ou Gazebo. En ancrant la simulation dans une reconstruction GS de l'environnement cible réel et en peuplant cette scène d'avatars humains photoréalistes et cinématiquement plausibles, l'approche réduit la distance de distribution entre entraînement et déploiement. Il s'agit d'une contribution méthodologique, pas d'un produit commercialisé ; les résultats restent à ce stade des démonstrations académiques, et les métriques annoncées (temps de cycle, taux de succès) gagneraient à être contextualisées par des conditions de test plus variées.

Le Gaussian Splatting a émergé comme technique de reconstruction 3D rapide et photoréaliste depuis les travaux de Kerbl et al. en 2023, et plusieurs groupes l'ont depuis exploré pour la simulation robotique, notamment pour la manipulation (voir les travaux de RoboGSim ou GaussianWorld). ReaDy-Go se distingue en ciblant la navigation en présence de piétons, un cas d'usage critique pour les robots de livraison indoor et les plateformes de service en espace public. Sur ce segment, les concurrents directs incluent les pipelines basés sur NeRF (plus lents à l'entraînement), les simulateurs procéduraux type NVIDIA Omniverse, et des approches comme UniSim ou HabitatSim. Aucun acteur européen n'est cité dans le preprint, mais des équipes comme Enchanted Tools (robotique de service, France) ou les labos de navigation de l'INRIA pourraient trouver dans ReaDy-Go une brique de simulation réutilisable. La page projet est accessible et le code pourrait être publié ; les prochaines étapes naturelles seraient des tests à plus grande échelle avec diversité de populations et d'environnements, et une intégration dans des stacks de navigation open-source comme Nav2.

Impact France/UE

Cette méthode de simulation photoréaliste à base de Gaussian Splatting pourrait être réutilisée par des équipes européennes de navigation robotique (INRIA, Enchanted Tools) pour réduire le sim-to-real gap sans dépendre de simulateurs propriétaires comme Isaac Sim ou NVIDIA Omniverse.

À lire aussi

SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion
1arXiv cs.RO 

SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion

Des chercheurs présentent SplatSearch, une nouvelle architecture de navigation robotique permettant à un robot mobile de retrouver un objet ou une personne spécifique à partir d'une seule image de référence, prise sous un angle arbitraire. Le système s'appuie sur des reconstructions 3D par Gaussian Splatting (3DGS) construites à partir de vues éparses, une technique bien moins gourmande en données que les reconstructions denses classiques. SplatSearch génère plusieurs points de vue synthétiques autour des objets candidats grâce à cette carte 3DGS, puis utilise un modèle de diffusion multi-vues pour compléter les zones manquantes des images rendues, ce qui permet une mise en correspondance robuste avec l'image cible. Une politique d'exploration de frontières a également été développée : elle combine le contexte visuel des vues synthétisées et le contexte sémantique de l'image but pour hiérarchiser les zones à explorer en priorité. Les auteurs rapportent des performances supérieures aux méthodes de référence actuelles, mesurées en taux de réussite et en longueur de chemin jusqu'au succès, sur des environnements domestiques photoréalistes et des tests en conditions réelles. Une étude d'ablation confirme la pertinence des choix de conception retenus. Cette avancée s'attaque à un problème central pour la robotique de service et l'inspection industrielle : la capacité d'un robot à localiser une cible précise dans un environnement inconnu, sans dépendre d'un scan 3D exhaustif préalable. La navigation par instance d'image (Instance Image Goal Navigation) est particulièrement exigeante lorsque l'image de référence est prise sous un angle très différent de celui du robot au moment de la recherche, un scénario fréquent en usage réel mais souvent contourné dans les benchmarks. En misant sur des reconstructions éparses complétées par diffusion plutôt que sur des cartes 3D denses coûteuses à construire, l'approche pourrait réduire le temps de calibration nécessaire au déploiement de robots de recherche et de récupération d'objets, un enjeu concret pour les intégrateurs travaillant sur des AMR en environnement domestique ou logistique. Le travail s'inscrit dans la lignée des recherches combinant 3D Gaussian Splatting et navigation robotique, une technique de rendu apparue en 2023 et rapidement adoptée pour la cartographie temps réel en raison de sa rapidité par rapport aux champs de radiance neuronaux (NeRF). SplatSearch se positionne face aux méthodes état de l'art existantes en IIN, qu'il dépasse selon les métriques de taux de réussite et de longueur de chemin rapportées dans l'article, republié en version 2 sur arXiv. Le papier ne précise pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, validée par simulation et par des tests réels limités, sans indication d'un acteur français ou européen impliqué.

RecherchePaper
1 source
Habitat-GS : un simulateur de navigation haute fidélité basé sur le Gaussian Splatting dynamique
2arXiv cs.RO 

Habitat-GS : un simulateur de navigation haute fidélité basé sur le Gaussian Splatting dynamique

Des chercheurs du laboratoire ZJU3DV, rattaché à l'université du Zhejiang, ont publié Habitat-GS, un simulateur de navigation pour agents d'intelligence artificielle incarnée, construit comme extension du simulateur Habitat-Sim. Contrairement aux moteurs classiques qui reposent sur la rasterisation de maillages 3D, coûteux à produire de façon photoréaliste à grande échelle, Habitat-GS intègre un rendu par 3D Gaussian Splatting (3DGS) en temps réel ainsi qu'un import d'assets 3DGS compatible avec des sources variées. Le système ajoute des avatars humains gaussiens, dynamiques et pilotables, qui servent à la fois d'entités visuelles photoréalistes et d'obstacles de navigation actifs, tout en conservant la compatibilité complète avec l'écosystème logiciel Habitat. Les auteurs ont évalué le système sur des tâches de navigation point à point et sur des scénarios de navigation en présence d'avatars. Le code est publié sur GitHub (zju3dv/habitat-gs), sous la référence arXiv:2604.12626. Pour l'écosystème de la robotique incarnée, l'enjeu dépasse le rendu graphique: la fidélité visuelle d'un simulateur conditionne directement la capacité d'un agent entraîné virtuellement à généraliser au monde réel, un point de friction classique entre simulation et déploiement effectif. Les auteurs rapportent que des agents entraînés sur des scènes 3DGS généralisent mieux entre domaines que ceux entraînés sur des maillages classiques, et que les avatars gaussiens permettent d'apprendre des comportements de navigation dits "human-aware", capables d'anticiper des humains en mouvement plutôt que de les traiter comme des obstacles fixes. Pour les équipes développant des piles de navigation destinées à des robots mobiles ou humanoïdes opérant en entrepôt ou en environnement partagé avec des humains, cela ouvre une voie pour réduire le coût de création d'environnements d'entraînement réalistes. Habitat-GS s'inscrit dans la lignée de Habitat-Sim, simulateur open source développé par Meta AI Research et largement utilisé comme banc d'essai académique pour l'IA incarnée. Il capitalise sur le Gaussian Splatting, technique de rendu de champs de radiance devenue une alternative rapide aux NeRF pour la reconstruction photoréaliste de scènes. Le travail reste une brique de recherche plutôt qu'un produit commercial: aucun partenariat industriel, déploiement robotique réel ni calendrier de disponibilité n'est annoncé, et les résultats reposent sur des benchmarks internes. La publication du code laisse néanmoins la porte ouverte à une adoption par d'autres laboratoires travaillant sur des agents de navigation appelés à évoluer parmi des humains.

RecherchePaper
1 source
SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale
3arXiv cs.RO 

SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale

Sortie automatisée de mouvements corporels complets à partir de ces trajectoires. Un chercheur propose SONG, une plateforme de simulation pour la navigation sociale robotique, construite sur le 3D Gaussian Splatting (3DGS), une technique de rendu photoréaliste qui reconstruit à la fois les scènes et les avatars humains évoluant dedans. Les piétons virtuels ne suivent pas des scripts fixes: leurs trajectoires sont générées par un grand modèle de langage de façon sémantiquement cohérente, puis converties en mouvements corporels continus via un générateur conditionné par trajectoire. Autour de cette plateforme, les auteurs construisent SONG-Bench, un ensemble de scénarios d'évaluation classés par niveau de difficulté, associé à une suite de métriques multidimensionnelles couvrant l'efficacité du déplacement, la sécurité et le respect des conventions sociales. Le travail est décrit dans un article déposé sur arXiv (2607.25219v1) comme une nouvelle soumission. L'enjeu dépasse le simple outil de test. Jusqu'ici, les simulateurs de navigation sociale souffraient d'un compromis frustrant: soit ils offraient des observations visuelles pauvres, soit ils manquaient d'avatars humains mobiles, soit leur rendu et le comportement des piétons restaient trop éloignés du réel pour valider des algorithmes de navigation guidés uniquement par la vision embarquée. En évaluant des méthodes de référence sur SONG-Bench, les auteurs tirent trois constats qui pèsent sur tout le secteur de la robotique mobile: la navigation sociale basée vision est loin d'être résolue, les modèles actuels présentent un déficit de sécurité plus criant encore que leurs manquements en étiquette sociale, et l'entraînement sur des données réelles compte davantage que la simple augmentation de la taille des modèles. Point notable, les auteurs montrent qu'un ajustement fin sur les données qu'ils ont constituées améliore concrètement le taux de réussite en conditions réelles, ce qui distingue cette contribution d'une simple démonstration en simulation. Ce travail s'inscrit dans une trajectoire de recherche qui est passée d'environnements 2D simplifiés à des cadres visuels plus exigeants, où le robot ne dispose que de sa caméra embarquée pour se comporter correctement en présence d'humains. Les auteurs présentent SONG comme un banc d'essai destiné à structurer la prochaine génération de recherches sur la navigation sociale visuelle, sans toutefois annoncer de partenariat industriel ou de déploiement au-delà du cadre académique à ce stade.

RecherchePaper
1 source
Grounding multimodal incarné pour la manipulation mobile à vocabulaire ouvert via Gaussian Splatting sémantique 3D
4arXiv cs.RO 

Grounding multimodal incarné pour la manipulation mobile à vocabulaire ouvert via Gaussian Splatting sémantique 3D

Une équipe de recherche présente, dans un preprint publié sur arXiv (2608.10756v1) début août 2026, un nouveau système de manipulation mobile robotique combinant vision, langage et géométrie 3D. Baptisé Semantic-3DGS, le framework s'appuie sur du Gaussian Splatting sémantique multi-vues actif, un positionnement du socle du robot conditionné par l'atteignabilité de la cible, et une politique vision-langage-action (VLA) basée sur la diffusion. Les indices sémantiques 3D ne sont injectés que dans les derniers blocs de l'expert d'action, afin de préserver les a priori du modèle pré-entraîné. Testé sur 50 essais réels par tâche dans des espaces domestiques, le système complet atteint 60% de réussite sur des tâches longues, contre 40% pour PointVLA et 28% pour DexVLA, deux approches VLA de référence. En environnement fortement encombré, il grimpe à 74% de réussite, contre 52% pour une variante mono-vue et 46% pour PointVLA. Le système conserve 75% de réussite même après un décalage de hauteur de caméra de 75 cm, et supprime les erreurs de préhension déclenchées par des photos d'objets plutôt que les objets réels. Ces résultats ciblent un point faible connu des politiques VLA actuelles: leur dépendance à des représentations 2D ou implicites qui s'effondrent dès que la scène change de point de vue, se charge d'objets ou présente des leurres visuels comme une photo d'objet. En montrant qu'un ancrage 3D sémantique explicite et réactualisable améliore la robustesse de 20 à 30 points de réussite selon les scénarios, l'étude nuance l'idée que les grands modèles VLA généralistes suffiraient seuls à garantir une manipulation fiable hors laboratoire. Pour les intégrateurs et les équipes R&D en robotique domestique et industrielle, le signal est clair: l'écart entre démonstrations soignées et déploiement en environnement encombré reste largement une question de perception 3D, pas seulement de politique d'action. Cela conforte une tendance plus large à hybrider les architectures VLA avec des représentations spatiales explicites plutôt que de tout confier à l'apprentissage bout en bout. Le travail s'inscrit dans la lignée des méthodes de rendu par Gaussian Splatting, popularisées pour la reconstruction de scènes 3D, ici détournées vers l'ancrage sémantique en robotique. Il se positionne explicitement contre PointVLA et DexVLA, deux approches représentatives de l'état de l'art en VLA pour la manipulation, utilisées comme lignes de base dans les tests. Contrairement aux annonces commerciales du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, il s'agit ici d'une contribution académique publiée en preprint, sans robot commercial ni calendrier de déploiement associé. Aucun acteur français ou européen n'est cité dans l'étude. Les auteurs présentent leurs résultats comme une preuve de concept en laboratoire, sur des tâches de manipulation en espace domestique restreint et en few-shot, plutôt qu'un système prêt pour un déploiement à grande échelle.

RechercheActu
1 source