PreferenceFlow : guidage à l'inférence des politiques robotiques à flow matching à partir des interventions humaines
Des chercheurs proposent PreferenceFlow, une méthode qui améliore au moment de l'inférence une politique robotique « flow-matching » déjà entraînée, sans signal de récompense et sans modifier ses poids. Le principe : lorsqu'un opérateur humain reprend la main sur le robot, son segment d'action (« chunk ») est apparié à celui que le robot aurait généré depuis le même état de conditionnement. Ces paires servent à entraîner un modèle de préférence. À l'inférence, les auteurs reprennent la mise à jour d'échantillonnage QGF, en remplaçant son gradient de valeur par le gradient de préférence, calculé sur une estimation de l'action « propre ». Deux termes de perte encadrent ce guidage : une perte de plafonnement limite les gradients excessifs sur les paires d'intervention, et une perte de gradient nul décourage tout guidage près des actions issues de démonstrations expertes. Sur quatre tâches réelles d'insertion de précision avec un bras Franka, le taux de succès moyen atteint 90,5 %, contre 69 % pour la politique figée. Le travail est publié sur arXiv (2609.36872, première version) et n'a pas encore été relu par des pairs.
L'enjeu est très concret pour les intégrateurs. Les politiques génératives (flow-matching ou diffusion, dont la famille Pi-0) savent exprimer des comportements complexes, mais elles dérapent face aux décalages de distribution rencontrés en production : une pièce légèrement déplacée, un jeu d'ajustement différent. Les correctifs classiques par apprentissage par renforcement exigent une fonction de récompense difficile à écrire en manipulation réelle, et un réentraînement du modèle de base. Ici, la correction passe par des interventions de téléopérateurs, déjà courantes en déploiement, sans toucher aux poids, ce qui simplifie la validation et évite de dégrader les compétences existantes. Le gain de plus de 21 points sur des insertions de précision est significatif, mais des réserves s'imposent : quatre tâches, un seul type de robot (Franka), aucun chiffre fourni sur le nombre d'interventions nécessaires ni sur le temps de cycle ou le surcoût de calcul du guidage. Les ablations indiquent que la régularisation des gradients et l'ordre correct des étiquettes de préférence comptent, mais seulement « dans les conditions évaluées ».
Ce travail s'inscrit dans une série de méthodes visant à corriger les politiques VLA et génératives après entraînement : apprentissage à partir d'interventions humaines (type HG-DAgger), guidage par fonction de valeur (QGF, sur lequel PreferenceFlow s'appuie) et affinage par renforcement, plus lourd. L'approche par préférences locales se positionne entre ces options, avec un coût d'annotation réduit à des corrections ponctuelles. Les prochaines étapes à surveiller sont la démonstration sur d'autres embodiments, sur des politiques de grande taille comme Pi-0 ou GR00T, et sur des tâches longues, ainsi que la mesure de la latence ajoutée, déterminante pour la commande en temps réel. Aucun déploiement industriel ni produit n'est annoncé : il s'agit d'un résultat de recherche.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




