RFPO : optimisation de politique par flux rectifié pour le contrôle de l'IA incarnée
Des chercheurs du groupe AIGeeksGroup publient sur arXiv (2610.10453) RFPO, pour Rectified Flow Policy Optimization, un cadre d'optimisation de politiques basées sur les flows, conçu pour que le contrôle reste fiable avec une seule étape d'intégration numérique. Le déploiement s'appuie sur un seul « étudiant » flow exécuté en un pas d'Euler. L'entraînement combine un Reflow en ligne sensible à la récompense, qui rectifie les trajectoires de transport induites par l'étudiant pendant l'apprentissage on-policy, et un contrôleur gaussien PPO gelé, qui fournit une supervision complémentaire dans l'espace des actions à budget d'intégration complet et intermédiaire. Les tests couvrent quatre plateformes : Unitree Go2, Boston Dynamics Spot, Unitree H1 et Unitree G1. En exécution à un pas, les retours restent à moins de 2,4 % de ceux obtenus à 64 pas, avec initialisation nulle comme aléatoire. Sur le Go2, un pas conserve 98,5 % de la récompense à 64 pas. La latence moyenne d'inférence embarquée passe de 4,39 ms à 0,08 ms, soit une accélération de 54,9 fois. Des expériences sur robot réel valident une locomotion stable à un pas. Le code et un site web sont publiés.
L'enjeu est très concret pour l'embarqué. Les politiques de diffusion et de flow matching séduisent par leur expressivité sur les actions continues, mais leur intégration itérative d'ODE coûte du calcul et de la latence, ce qui pèse sur les boucles de contrôle rapides et sur les budgets énergétiques des robots mobiles. Réduire naïvement le nombre de pas dégrade le contrôle, car une politique optimisée en pas complets n'est pas contrainte à rester fiable sous intégration grossière. Les auteurs nomment cet écart « few-step discretization gap ». Passer de 4,39 ms à 0,08 ms libère de la marge pour des fréquences de contrôle élevées ou pour des calculateurs modestes. Il faut toutefois lire ces chiffres avec prudence : les scores principaux viennent de simulation, la validation réelle est présentée comme qualitative (stabilité de la marche) sans taux de réussite ni durée. Les tâches sont de la locomotion, pas de la manipulation, où la multimodalité des actions est plus exigeante. Le gain porte aussi sur la latence de la politique seule, pas sur la chaîne perception-contrôle complète.
Le travail s'inscrit dans l'effort pour rendre les politiques génératives exploitables en temps réel, après la diffusion à nombreuses étapes, puis les approches de distillation, de consistency models et de flow matching à peu de pas. Il s'écarte de la distillation classique, car l'étudiant est rectifié pendant l'apprentissage par renforcement et non après coup. L'usage d'un PPO gaussien gelé comme guide rappelle que les baselines simples restent solides en locomotion. Les plateformes choisies, majoritairement Unitree, reflètent la domination du matériel chinois bon marché dans la recherche académique. Aucun acteur européen n'est cité. La suite logique serait une extension à la manipulation, à des politiques vision-langage-action de grande taille et à davantage de tests sur robot réel avec des métriques publiées.
Dans nos dossiers




