
QF3 : apprentissage par renforcement à base de flux rapide avec gradients Q filtrés
Des chercheurs publient QF3 (Fast Flow RL with Filtered Q-Gradients), un algorithme d'apprentissage par renforcement (RL) off-policy et online qui entraîne des politiques de type « flow » (génératives, basées sur le flow matching). L'entraînement combine la perte de flow matching et le gradient d'action du critique Q, rétropropagé à travers une prédiction en un seul pas de la sortie du flow. Un filtre limite l'application de ce gradient aux seules dimensions d'action restées proches de l'action stockée dans le replay buffer, là où le critique et la prédiction à un pas sont jugés fiables. Les auteurs affirment que QF3 est la première méthode de RL off-policy à base de flow qui entraîne des politiques de locomotion humanoïde from scratch et les transfère en zero-shot sur le robot réel. Associé à une recette d'entraînement off-policy à haut débit, il apprend des politiques de locomotion et de motion tracking humanoïdes avec une accélération de 10x en temps réel (wall-clock) par rapport à FPO++, une méthode récente de RL on-policy pour politiques flow. Les auteurs l'appliquent aussi au fine-tuning de politiques de manipulation pré-entraînées sur les benchmarks ABC-Sim et Robomimic. Il s'agit d'un preprint arXiv (v1), non relu par les pairs, accompagné d'un site de projet.
L'intérêt tient à la jonction de deux tendances. Les politiques flow (et diffusion) sont devenues la classe standard pour apprendre des comportements par imitation, notamment dans les VLA (vision-language-action), mais leur amélioration par RL reste difficile : rétropropager à travers un échantillonnage multi-étapes est instable et coûteux, ce qui a poussé vers des méthodes on-policy comme FPO++, gourmandes en échantillons. Si le gain de 10x se confirme hors du cadre des auteurs, il réduirait le coût de la locomotion humanoïde apprise en simulation, puis transférée au réel (sim-to-real). Il suggérerait aussi qu'un seul algorithme peut servir à la fois à l'entraînement from scratch et au raffinement de politiques issues de démonstrations. Pour les intégrateurs, cela ouvre la voie à un affinage par interaction de politiques pré-entraînées, sans repartir de zéro. Il faut toutefois rester prudent : la revendication de « première » est auto-déclarée, et le résumé ne donne ni plateforme humanoïde, ni nombre d'essais matériels, ni taux de succès chiffrés en manipulation. Le « 10x » est mesuré face à une seule méthode de référence, sur des tâches choisies par les auteurs.
Ces travaux s'inscrivent dans la montée des politiques génératives en robotique, popularisées par Diffusion Policy puis par des modèles flow comme Pi-0, et dans l'effort pour combiner imitation et RL. Les concurrents directs sont les méthodes de RL pour politiques flow ou diffusion, dont FPO++ est la référence citée, ainsi que les approches de fine-tuning de VLA par RL. Les prochaines étapes à surveiller sont la publication du code et des détails matériels sur le site du projet, des réplications indépendantes et une éventuelle application à des VLA de grande taille ou à des tâches de loco-manipulation, où le coût d'entraînement reste le principal verrou.
Dans nos dossiers




