
SynthDemo-RL : dépasser la barrière de récompense nulle dans l'adaptation VLA grâce à des démonstrations synthétiques guidées par LLM
SynthDemo-RL est un framework enseignant-élevé pour l'adaptation par renforcement de modèles Vision-Language-Action (VLA), présente dans un article publie le 21 septembre 2026 sur arXiv. Un enseignant automatise convertit l'état privilégié du simulateur en trajectoires de manipulation réussies, distillées en un modèle VLA élevé par fine-tuning supervise puis affine par PPO a récompenses binaires de succès. Sur LIBERO-PRO, variante perturbée de LIBERO sans démonstrations disponibles, une politique pi_0.5 déjà fine-tunee sur LIBERO original échoue totalement sur 27 des 57 taches évaluées, et un PPO direct a budget égal n'en sauve que 10. Avec 50 trajectoires synthétiques par tache et sans démonstration humaine, SynthDemo-RL sauve les 27 taches et atteint 97,8% et 97,1% de réussite sur les axes Position et Task de LIBERO-PRO, contre 96,0% sur LIBERO standard, a 1,7 point du modèle entraine sur 50 démonstrations humaines. La méthode est aussi validée sur RoboTwin 2.0, des trajectoires issues d'un jumeau numérique MuJoCo s'exécutant en boucle ouverte sur un robot physique.
L'apport est surtout méthodologique : les auteurs montrent qu'un RL a récompense binaire peut rester bloque a 0% sur des taches jamais atteintes par hasard, échec que le taux de réussite moyen d'un benchmark masque généralement. Leur métrique de couverture de récompense rend ce trou visible. Pour les équipes robotique, l'intérêt est de réduire la dépendance a la téléopération humaine, couteuse et peu scalable, tout en approchant la performance de politiques entraînées sur démonstrations réelles, avec seulement 1,7 point d'écart. Le test sur robot physique, limite a une exécution en boucle ouverte, reste un indice et non une preuve de transfert réel robuste.
Le travail s'appuie sur pi_0.5, une politique VLA de Physical Intelligence, et sur LIBERO, benchmark de simulation très utilise en manipulation robotique, dont LIBERO-PRO est une variante perturbée destinée a en révéler les limites cachées. Il s'inscrit dans une recherche visant a affiner les VLA par renforcement plutôt que par seule imitation, pour réduire le cout de la téléopération ; aucun déploiement industriel ni pilote commercial n'est annonce, le résultat restant a ce stade un travail de simulation valide par un unique test de transfert sur robot physique en boucle ouverte.
Dans nos dossiers



