
GaussianDream++ : modélisation 3D gaussienne efficace du monde pour la manipulation robotique
GaussianDream++, décrite dans un article publié en août 2026 sur arXiv (2608.25659), est une méthode d'entraînement pour les politiques Vision-Language-Action (VLA) de manipulation robotique. Elle succède à GaussianDream, dont la reconstruction 3D en Gaussiennes mélangeait état, dynamique et action dans un pipeline dense (VGGT/TGE) coûteux. La nouvelle version insère seulement 20 "World State Tokens" et "World Prediction Tokens" dans le backbone VLA ; une tête dédiée, active seulement à l'entraînement, les décode en scène courante et prédiction future partageant les mêmes primitives Gaussiennes, avec une factorisation statique/dynamique isolant le mouvement pertinent. À l'inférence, cette tête et le pipeline lourd disparaissent : ne restent que les 20 tokens. Résultat : 98,6% de réussite sur LIBERO, 87,8% sur LIBERO-Plus, et sur robot réel un taux de succès moyen porté de 29,2% à 52,5% face à une politique pi_0.5 reproduite.
Ce résultat répond à une limite connue des politiques VLA : l'imitation d'actions seule supervise mal la structure 3D métrique et la dynamique physique à court terme, tandis que les approches prédictives en RGB ou en espace latent alourdissent le déploiement. En montrant qu'une supervision géométrique riche à l'entraînement peut être totalement retirée à l'inférence sans perte de performance, GaussianDream++ répond au compromis coût/richesse qui freine l'adoption des politiques géométriques par les intégrateurs devant faire tourner ces modèles en boucle fermée sur du matériel embarqué. Le quasi-doublement du taux de succès sur robot réel suggère que cette supervision comble une partie de l'écart simulation-vers-réel, plutôt que d'apporter un simple gain en simulation.
GaussianDream++ corrige la principale faiblesse de GaussianDream, sa dépendance à un pipeline VGGT/TGE mêlant plusieurs signaux dans un même préfixe. Elle s'inscrit dans un paysage de politiques VLA concurrentes, comme les modèles pi0 et pi0.5 de Physical Intelligence utilisés ici comme référence, GR00T N2 de NVIDIA ou Helix de Figure AI, chacune arbitrant différemment entre richesse de représentation et coût d'inférence temps réel. L'article ne précise ni partenaire industriel ni calendrier de déploiement : à ce stade, il s'agit d'un résultat de recherche évalué sur des bancs d'essai standards et un nombre limité d'expériences sur robot réel, sans détail sur les plateformes utilisées.
Dans nos dossiers




