DriftOPD : distillation à divergence KL inverse au niveau séquence pour politiques VLA en une seule étape
Des chercheurs publient sur arXiv (2610.00317) DriftOPD, un cadre de distillation « on-policy » au niveau séquence, destiné aux experts d'action continus des modèles Vision-Language-Action (VLA). Ces experts d'action produisent de courts segments d'actions (« action chunks ») exécutés en commande à horizon glissant. L'entraînement par segment, pratique d'une morphologie de robot à l'autre, optimise la vraisemblance locale des actions sans tenir compte du succès de la tâche sur la durée. DriftOPD ne nécessite ni modèle enseignant séparé, ni déploiement de la politique (« rollout ») en boucle fermée. Les auteurs montrent que la divergence de Kullback-Leibler inverse au niveau séquence se décompose en deux termes : une KL inverse par segment et un terme de « potentiel futur » qui mesure l'effet à long terme de l'action courante. Le premier est optimisé par un objectif de « drifting » à une étape. Le second l'est par un critique Q appris à partir de démonstrations hors ligne. Le résultat est un expert d'action qui génère ses actions en une seule étape. Testé sur plusieurs architectures VLA, en simulation et en manipulation réelle, DriftOPD surpasse généralement les méthodes de distillation à une étape existantes. Il atteint un taux de succès comparable à celui des politiques enseignantes multi-étapes. Le résumé ne donne ni chiffres de succès, ni robots, ni architectures précis.
L'enjeu est de lever un compromis qui pèse sur les politiques VLA. Les experts d'action de type diffusion ou flow-matching donnent de bons résultats mais demandent plusieurs étapes d'inférence, d'où une latence gênante pour le contrôle réactif. Les distiller en une étape accélère l'exécution, mais au prix d'une perte de qualité. Le gain annoncé tient à ce que le comportement à long terme est transféré sans interaction en ligne. Or l'apprentissage par renforcement sur robot réel coûte cher en temps machine, en supervision humaine et en risque de casse. Si les résultats se confirment, un intégrateur pourrait affiner une politique à partir de ses seules démonstrations existantes, sans campagne de collecte supplémentaire. Il faut rester prudent : il s'agit d'un préprint non évalué par des pairs, et seules les tables complètes (tâches, nombre d'essais, variance, latences mesurées) permettront de juger si « comparable à l'enseignant » vaut aussi pour des tâches longues et peu tolérantes aux erreurs.
Ce travail s'inscrit dans la course à l'efficacité d'inférence des VLA. Pi-0 de Physical Intelligence, GR00T de NVIDIA et les systèmes à double architecture comme Helix de Figure reposent sur des têtes d'action génératives. La distillation en une étape, les modèles de cohérence et les approches inspirées du « drifting » visent à réduire leur coût de calcul. En parallèle, des méthodes d'apprentissage par renforcement post-entraînement cherchent à optimiser le succès de tâche, mais exigent des déploiements réels. DriftOPD se place entre ces deux familles : il reprend l'objectif de séquence de la seconde avec le coût hors ligne de la première. Les prochaines étapes à surveiller sont la publication du code et des résultats détaillés, ainsi que la reproduction par d'autres laboratoires sur des plateformes et tâches variées. La mesure de la latence de bout en bout sur matériel embarqué sera aussi déterminante.
Dans nos dossiers


