Le bruit d'exploration modulé par l'incertitude empêche l'effondrement des tâches dans le fine-tuning RL en ligne d'une politique VLA à flow matching
Une équipe de recherche publie le 25 septembre 2026 sur arXiv (2609.28838) une étude sur le fine-tuning par apprentissage par renforcement en ligne de politiques vision-langage-action (VLA) à flow-matching, la piste privilégiée pour des robots qui continuent d'apprendre après déploiement. Les auteurs testent SmolVLA, modèle compact de 450 millions de paramètres développé par Hugging Face, entraîné avec l'algorithme PPO et un échantillonnage stochastique (SDE) sur le benchmark de manipulation LIBERO-10, à budget de calcul identique et volontairement restreint. Trois stratégies de bruit d'exploration sont comparées: un bruit à échelle fixe, un réseau de bruit appris façon ReinFlow, et un contrôleur dit "uncertainty-gated" qui redistribue l'exploration entre les tâches à partir de signaux de nouveauté et de compétence, sans étiquette de tâche ni découpage en épisodes. Résultat mesuré: le bruit fixe fait s'effondrer des tâches individuelles ("task collapse") sur deux graines aléatoires sur trois, le bruit appris s'effondre sur les trois graines avant l'itération 200, alors que le contrôleur ne s'effondre sur aucune des trois. Aucun des trois réglages ne dépasse la simple baseline de clonage comportemental dans ce budget. Fait technique annexe: en entraînement bfloat16 sans copie maîtresse fp32, 96,02% des poids du réseau d'action restent identiques bit à bit sur trois itérations consécutives, tandis qu'une copie fp32 au même taux d'apprentissage fait s'effondrer les deux bras testés, sur une seule graine observée.
L'intérêt pour l'industrie tient au problème qu'elle documente plutôt qu'à une solution livrée: le fine-tuning RL en continu, promis comme moyen de faire progresser des robots VLA une fois sur le terrain, peut détruire silencieusement la compétence sur des tâches précises alors que les métriques agrégées restent rassurantes, un piège pour tout intégrateur qui déploierait une boucle d'apprentissage continu en production sans suivi tâche par tâche. L'étude tempère aussi l'hypothèse selon laquelle le RL en ligne améliorerait mécaniquement des politiques VLA préentraînées: dans ce budget de calcul, aucune variante ne bat le clonage comportemental initial. C'est un signal de prudence pour les décideurs B2B face aux discours sur l'apprentissage continu des robots humanoïdes ou manipulateurs, à valider par des mesures par tâche et non par des courbes de récompense globales.
Le travail s'inscrit dans la lignée des politiques VLA à flow-matching type Pi-0 ou GR00T N2, en s'appuyant sur SmolVLA, la politique VLA compacte et ouverte publiée par Hugging Face, et sur LIBERO, benchmark standard d'évaluation de politiques de manipulation. Il prend pour référence directe ReinFlow, approche antérieure de bruit appris pour les politiques de flux, utilisée ici comme point de comparaison plutôt que comme solution retenue. Il s'agit d'un article de recherche, pas d'un produit livré ni d'un pilote industriel: les auteurs mettent à disposition leurs outils de mesure du collapse par tâche selon quatre définitions, ainsi que leurs méthodes de recalcul du bruit et d'étalonnage instrumental, sans calendrier de déploiement annoncé.
Aucun acteur ni déploiement français ou européen mentionné dans l'étude, seul le modèle SmolVLA (Hugging Face, société d'origine française) sert de testbed de recherche.
Dans nos dossiers




