
Post-entraînement en ligne stable et efficace pour VLA en conditions réelles via l'amélioration de politique ancrée sur le replay asynchrone
Une équipe de recherche publie sur arXiv (papier 2609.22888, soumis en septembre 2026) une méthode baptisée RAPolicy (Replay-Anchored Policy improvement), destinée a l'entrainement en ligne de modèles vision-langage-action (VLA) sur robot réel. Le système fait tourner en parallèle la collecte de trajectoires et l'apprentissage, en ancrant les mises a jour du critique et de l'acteur sur les actions rejouées depuis un buffer de replay plutôt que sur des prédictions d'actions futures. Le critique apprend des valeurs au niveau de blocs d'actions et construit ses cibles de Bellman sans prédire l'action suivante, ce qui réduit le calcul nécessaire. L'acteur, a flux en une seule étape, réutilisé le bruit initial stocke pendant le rollout et s'entraine par vraisemblance conditionnelle pondérée par l'avantage. Teste sur quatre taches isolées et un scenario conjoint a cinq taches en conditions réelles, avec un budget d'entrainement en ligne de seulement une a deux heures, RAPolicy part de politiques déjà affinées sur dix démonstrations par tache. Il atteint un taux de réussite moyen de 86,3% sur les taches isolées, et fait grimper le taux de réussite global du scenario multi-tache de 52% a 88%, tout en préservant les taches déjà maîtrisées et en améliorant les plus faibles.
Ce résultat s'attaque a un point de friction connu du post-entrainement en ligne des VLA sur robot réel: l'instabilité de l'apprentissage par renforcement lorsque les données arrivent en flux continu et que la politique change pendant la collecte. Pour les intégrateurs et décideurs B2B, l'enjeu concret est le cout d'adaptation: passer d'une politique généraliste a une compétence fiable sur une nouvelle tache en une a deux heures de pratique, avec seulement dix démonstrations de départ et moins d'interventions humaines que les méthodes de référence, change l'économie d'un déploiement capable d'apprendre sur site plutôt qu'en laboratoire. Le résultat va aussi a l'encontre de l'hypothèse répandue selon laquelle le fine-tuning en ligne des VLA reste trop instable hors des environnements simules, même si l'évaluation reste limitée a cinq taches et aux conditions de laboratoire des auteurs, sans réplication indépendante ni comparaison sur des taches plus complexes ou des robots tiers.
Cette approche s'inscrit dans la lignée des modèles VLA généralistes tels que Pi-0, GR00T N2 ou Helix, pretraines sur de larges corpus de démonstrations puis adaptes a des taches spécifiques, une étape qui repose habituellement sur davantage de démonstrations ou sur du reinforcement learning hors ligne, deux voies gourmandes en données ou fragiles en stabilité. RAPolicy se positionne comme une alternative asynchrone a ces méthodes, misant sur l'ancrage dans les trajectoires rejouées pour stabiliser simultanément critique et acteur. Les auteurs mettent a disposition une page de projet avec, selon toute vraisemblance, code et vidéos de démonstration, mais ne précisent ni institution ni calendrier pour une intégration a des piles VLA commerciales existantes.
Dans nos dossiers




