La gaussienne suffit : les priors par flow matching n'aident pas lors du fine-tuning de grands modèles de comportement
Une étude publiée sur arXiv en septembre 2026 (2609.27070) montre que remplacer le prior gaussien standard des politiques de diffusion ou de flow-matching par un prior non gaussien, plus proche de la distribution cible, n'améliore pas le fine-tuning de grands modèles de comportement (Large Behavior Models) préentraînés. Les auteurs testent trois modèles, LBM 1.0 du Toyota Research Institute, Pi-0.5 de Physical Intelligence et GR00T N1.5 de NVIDIA, sur plus de 100 000 essais en simulation couvrant plus de 40 tâches et deux plateformes, ainsi que 1250 essais sur matériel réel portant sur cinq tâches de manipulation bimanuelle. Dans quasiment tous les cas, le prior non gaussien produit des résultats statistiquement indiscernables, voire pires, que le prior gaussien classique; un éventuel avantage n'apparaît que pour de très faibles fractions de données de fine-tuning.
Ce résultat contredit l'hypothèse répandue selon laquelle un prior appris, plus proche de la cible, apporterait un gain supplémentaire lors du fine-tuning de modèles préentraînés, un bénéfice pourtant bien établi à l'entraînement from scratch. Pour les intégrateurs qui bâtissent leurs déploiements sur des modèles vision-language-action génériques, l'étude suggère que l'effort d'ingénierie compte moins sur le design du bruit d'entrée que sur l'entraînement de l'encodeur: les politiques fine-tunées convergent vers des actions similaires quel que soit le prior, alors que leurs embeddings divergent fortement du préentraînement. Une ablation du taux d'apprentissage confirme que l'entraînement de l'encodeur reste le facteur dominant de la performance finale, loin devant le choix du prior.
L'étude s'inscrit dans la vague de modèles génériques de manipulation robotique préentraînés sur de larges corpus de démonstrations, à l'image de LBM (Toyota Research Institute), de la famille Pi de Physical Intelligence (Pi-0, Pi-0.5) ou de GR00T (NVIDIA). Les gains procurés par des priors non gaussiens n'avaient jusqu'ici été démontrés qu'à l'entraînement from scratch; ce travail est le premier à tester leur transfert au paradigme dominant de la robotique généraliste en 2026, le fine-tuning de fondations préentraînées. Les auteurs concluent en identifiant des pistes pour déterminer dans quelles conditions, notamment à très faible volume de données cibles, un prior appris pourrait malgré tout apporter un bénéfice.
Les intégrateurs européens qui fine-tunent des modèles VLA génériques (LBM, Pi-0.5, GR00T) peuvent appliquer ces conclusions pour prioriser l'entrainement de l'encodeur plutôt que le design du prior.




