FastOPD : distillation sur politique pour un déploiement léger des modèles VLA
Des chercheurs proposent FastOPD, un cadre de distillation « on-policy » qui transforme un grand modèle VLA (Vision-Language-Action) en élève compact, déployable sur un robot réel. La méthode adapte une flow map pour fournir au modèle élève une supervision à partir d'un seul état du modèle enseignant, puis la combine avec un objectif d'auto-cohérence afin que l'élève apprenne la dynamique de l'enseignant. Les auteurs affirment aussi démontrer théoriquement que l'élève distillé peut retrouver une distribution équivalente à celle d'un enseignant idéal à peu d'étapes. Sur le benchmark de simulation LIBERO, FastOPD conserve 84 % des performances de π0.5 avec seulement deux étapes d'inférence, ce qui réduit la latence de 78,1 % et dépasse les méthodes de distillation à peu d'étapes existantes sur le taux de succès moyen. Avec LingBot-VLA comme enseignant, l'approche gagne 15,9 points de pourcentage en succès à une seule étape par rapport à l'élève de base sur RoboTwin 2.0. Elle est aussi appliquée à un World Action Model (WAM), et un élève compact distillé de MolmoAct2 a été déployé sur un robot réel.
L'enjeu est le coût de calcul des VLA, qui croît avec la taille des modèles de fondation et complique leur exécution embarquée à fréquence de contrôle suffisante. Les solutions courantes consistent à concevoir des architectures plus petites ou à réduire les étapes de débruitage des politiques à flux. FastOPD vise une troisième voie : garder le modèle massif comme enseignant et distiller un élève léger. Le résultat est utile pour les intégrateurs, car il suggère qu'une partie de la capacité de généralisation peut être conservée sur du matériel moins coûteux. Il faut toutefois lire les chiffres avec prudence. Conserver 84 % des performances signifie perdre 16 % de succès, un écart qui peut compter en production, et LIBERO comme RoboTwin 2.0 sont des benchmarks simulés. La seule validation physique mentionnée est le déploiement sur un robot réel avec l'élève issu de MolmoAct2. Le résumé ne donne ni tâches, ni taux de succès, ni matériel, donc le fossé entre démonstration et réalité reste à mesurer.
Ce travail s'inscrit dans la course à l'efficacité des VLA, après la montée en échelle de modèles comme π0.5. Il compare ses résultats à des références de distillation à peu d'étapes, sans les nommer dans le résumé. Il teste aussi plusieurs enseignants (π0.5, LingBot-VLA, MolmoAct2 et un WAM), ce qui suggère une méthode relativement indépendante de l'architecture. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs, et aucun produit ni calendrier de déploiement commercial n'est annoncé. Les prochaines étapes à surveiller sont la publication du code et des poids, des mesures de latence sur calculateurs embarqués, et des évaluations sur des tâches longues en conditions réelles, qui diront si la distillation tient hors des benchmarks.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




