
VGFM : des politiques robotiques expressives grâce à un guidage dense par la valeur dans le flow matching
Publié le 15 septembre 2026 sur arXiv (2609.14261), un article de recherche propose VGFM, pour Value-Guided Flow Matching, un cadre de RL hors ligne pour entraîner des politiques robotiques à partir de grands jeux de données d'interactions. VGFM modélise la politique comme un modèle de flow matching conditionnel opérant directement dans l'espace des actions ("x-prédiction"), de sorte que chaque étape intermédiaire du processus génératif produit déjà une action valide, évaluable par un critique RL classique. Le guidage par la valeur s'applique ainsi à des instants de flux tirés aléatoirement, sans rétropropagation à travers toute la trajectoire ni réseau auxiliaire ou perte de distillation. Les auteurs évaluent la méthode sur les tâches de locomotion et de manipulation du benchmark OGBench, avec des protocoles rigoureux, et rapportent de bonnes performances sur un large éventail de tâches, avec un réglage minimal des hyperparamètres.
Ce résultat s'attaque à un verrou du secteur: coupler des politiques génératives expressives et multimodales, diffusion ou flow matching, capables de représenter des comportements complexes à long horizon, à des objectifs de valeur en RL hors ligne imposait jusqu'ici un lourd surcoût, rétropropagation coûteuse, réseaux auxiliaires ou distillation approximative. En s'en affranchissant tout en gardant la flexibilité à l'inférence, le nombre de pas de discrétisation de l'équation différentielle sous-jacente pouvant varier sans réentraînement, VGFM propose une voie plus simple et scalable pour affiner des politiques génératives via des signaux de valeur denses, un argument utile pour les équipes qui entraînent des politiques de type VLA sur des données offline volumineuses.
Ce travail s'inscrit dans la tendance du robot learning à remplacer les politiques déterministes par des modèles génératifs pour capturer la multimodalité des comportements. D'autres approches améliorent déjà des politiques génératives par RL via distillation ou guidage, jugés coûteux ou instables; VGFM s'en distingue en travaillant nativement dans l'espace des actions plutôt que dans le bruit latent. Il s'agit à ce stade d'une contribution académique évaluée uniquement en simulation sur OGBench, non d'un système déployé sur du matériel physique ni d'un produit commercial: aucun partenariat, pilote ou calendrier de déploiement n'est mentionné, et sa portée pratique dépendra de sa reproductibilité à plus grande échelle.
Dans nos dossiers




