Synthèse de démonstrations à partir d'un seul scan par Gaussian Splatting pour l'apprentissage de politiques visuomotrices
GaussianFactory, décrit dans un article déposé sur arXiv le 21 septembre 2026 (arXiv:2609.21112v1), génère des démonstrations d'entraînement pour des politiques robotiques visuomotrices à partir d'un unique scan vidéo, sans moteur physique dans la boucle de génération. Le système reconstruit la scène en réplique 3D Gaussian Splatting éditable, puis planifie de façon purement cinématique les prises et trajectoires pour les tâches de combinaison d'objets qu'elle permet, la formation des prises s'appuyant sur un modèle de contact appris une fois sur un jeu de données d'interactions. Le pipeline complet, du scan au déploiement, a été testé sur une scène simulée et sur un poste réel équipé d'un bras UR10e. Une politique de diffusion entraînée uniquement sur ces démonstrations synthétiques atteint 95,1% de réussite en simulation et 84,2% en conditions réelles.
Ce résultat s'attaque au goulot d'étranglement le plus coûteux de l'apprentissage par imitation en robotique : la collecte de démonstrations réelles, qui suppose un opérateur humain et un environnement identique à celui du déploiement. En cantonnant la simulation physique au seul modèle de contact, la méthode évite les approximations coûteuses des simulateurs classiques tout en restant fidèle au moment où la physique compte vraiment, celui du contact. L'écart entre 95,1% en simulation et 84,2% en réel rappelle qu'un fossé demeure entre reconstruction photoréaliste et transfert effectif sur robot physique, sur un nombre de tâches encore limité. Pour les équipes robotique en entreprise, l'approche esquisse une voie pour amorcer l'entraînement de politiques sur un nouveau poste de travail sans campagne de téléopération répétée.
Ce travail s'inscrit dans la recherche sur la réduction du coût de la donnée pour les politiques d'apprentissage par imitation, un enjeu central depuis la diffusion des politiques de diffusion et des architectures vision-langage-action en robotique. Les approches concurrentes reposent en général soit sur des simulateurs physiques complets, coûteux et sujets à l'écart sim-to-real, soit sur des démonstrations réelles collectées manuellement, donc difficiles à faire passer à l'échelle. Publié comme nouvelle soumission arXiv sans partenariat industriel annoncé, l'article ouvre la voie à une extension future vers davantage de tâches, de robots et de scènes, avant toute validation par la communauté ou adoption industrielle.
Dans nos dossiers




