PAC-DP : apprentissage de politiques de diffusion par une approche PAC-bayésienne
Voici la traduction/résumé demandé :
L'article scientifique publié sur arXiv le 28 juillet 2026 présente PAC-DP (PAC-Bayesian Diffusion Policy), une méthode d'entraînement pour les politiques de diffusion utilisées en manipulation robotique. Les auteurs modélisent la politique de diffusion comme un réseau de neurones bayésien et définissent une borne de généralisation PAC-Bayes, ce qui leur permet de dériver un nouvel objectif d'entraînement. Concrètement, cet objectif ajoute à la fonction de perte de débruitage standard un terme de régularisation basé sur la divergence de Kullback-Leibler entre la distribution postérieure et la distribution a priori des paramètres du réseau. Les résultats expérimentaux, obtenus sur plusieurs benchmarks de manipulation robotique, montrent une amélioration des performances de débruitage, une log-vraisemblance négative variationnelle plus faible, et des taux de réussite supérieurs par rapport aux politiques de diffusion classiques.
Cette contribution s'adresse à un problème concret et récurrent en robotique : l'entraînement des politiques de diffusion repose généralement sur un objectif de débruitage qui offre peu de garanties de généralisation, en particulier dans les régimes à données limitées typiques des applications robotiques réelles, où collecter des démonstrations expertes reste coûteux. Les auteurs montrent que les gains de performance sont les plus marqués justement dans ces régimes à faibles données et sur les tâches complexes, ce qui suggère que PAC-DP pourrait être particulièrement utile pour les intégrateurs et laboratoires de recherche disposant de jeux de démonstrations restreints plutôt que de flottes massives de collecte de données comme celles utilisées par les grands acteurs des politiques vision-langage-action (VLA).
Les politiques de diffusion se sont imposées ces dernières années comme une approche dominante pour l'apprentissage de comportements de manipulation complexes à partir de démonstrations, notamment dans des frameworks comme Diffusion Policy ou dans des composants de modèles VLA plus larges. Mais leur dépendance à un entraînement purement génératif, sans mécanisme explicite de contrôle de la généralisation, reste une limite reconnue par la communauté. PAC-DP s'inscrit dans une lignée de travaux cherchant à apporter des garanties théoriques plus rigoureuses à l'apprentissage de politiques robotiques, en s'appuyant sur le cadre PAC-Bayes déjà utilisé en apprentissage automatique classique. L'article, disponible en prépublication, ne précise pas encore de calendrier de publication en conférence ni de code source associé.
Dans nos dossiers




