
Structured-Diffuser : diffusion à priors structurés conditionnés par la tâche pour la planification de mouvement
Une équipe de recherche présente Structured-Diffuser, un planificateur de mouvement par diffusion décrit dans la troisième version d'un article déposé sur arXiv (2509.25685v3). Au lieu du bruit gaussien isotrope classique utilisé par les planificateurs de diffusion standards, la méthode dérive la moyenne et la covariance de la corruption d'un modèle de planification par processus gaussien (GPMP), encodant ainsi directement la fluidité de la trajectoire et la sémantique de la tâche dans le bruit lui-même. Une architecture à deux niveaux extrait d'abord des états clés épars et leur timing pour instancier cet a priori gaussien structuré, puis débruite la trajectoire complète en s'appuyant sur ces états comme observations bruitées. Sur trois tâches de planification de mouvement testées, les auteurs rapportent une meilleure réussite des tâches, un entraînement plus rapide et, selon les cas, des gains en efficacité des données et en fluidité de trajectoire, avec en complément une démonstration sur un humanoïde physique G1.
Pour les équipes de recherche en robotique, ce travail confirme une tendance à vouloir réduire la dépendance des planificateurs de diffusion à de gros volumes de données d'entraînement, un frein connu pour les modèles vision-langage-action comme Pi-0 ou GR00T N2. Les études d'ablation des auteurs indiquent qu'un bruit explicitement structuré apporte un bénéfice distinct du simple conditionnement neuronal du réseau de débruitage, ce qui nuance l'idée qu'un réseau bien conditionné suffirait à compenser un bruit générique. Le test sur un G1 réel reste toutefois une démonstration de recherche et non un déploiement produit, dans un domaine où l'écart entre performance en simulation et robustesse en conditions réelles demeure la principale zone d'incertitude.
La méthode s'inscrit dans la lignée des planificateurs de diffusion appliqués à la robotique, en les hybridant avec l'optimisation classique de trajectoire par processus gaussien de type GPMP. Elle se positionne comme une alternative de bas niveau, centrée sur la génération de trajectoires physiquement cohérentes, face aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui apprennent directement des politiques à partir d'entrées visuelles et langagières. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste à ce stade un travail de recherche publié sur arXiv, sans annonce de produit, de partenariat industriel ni de calendrier de déploiement commercial.
Dans nos dossiers




