
Plusieurs voies vers la réussite : un réglage fin par apprentissage par renforcement axé sur la diversité pour la généralisation des VLA
Des chercheurs ont publié sur arXiv (2610.09943) DRIVE, une méthode de fine-tuning par apprentissage par renforcement (RL) pour les politiques vision-langage-action (VLA), conçue pour améliorer la généralisation hors distribution. DRIVE regroupe des rollouts réalisés dans des conditions de tâche identiques et compare leurs trajectoires après alignement temporel. Il en dérive une récompense intrinsèque, conditionnée au succès, qui mesure la diversité comportementale relative. Seuls les succès diversifiés sont récompensés. Les échecs variés et les simples décalages de timing ne le sont pas. Sur les benchmarks LIBERO-Plus, ManiSkill3 et RoboTwin 2.0, la méthode gagne en moyenne 5,3 points de performance hors domaine (OOD) sur π0 et 2,0 points sur π0.5, par rapport au fine-tuning RL classique. Sur une plateforme physique bimanuelle AgileX PiPER-X, le taux de succès OOD moyen passe de 64,1 % à 73,3 %, soit +9,2 points.
Le point notable tient moins à la méthode qu'à l'analyse qui la motive. Les auteurs montrent que le RL contracte le comportement de manière globale, mais diversifie les trajectoires réussies. Il obtient un succès avec moins de rollouts et couvre une plus grande part de l'espace de solutions valides que le fine-tuning supervisé. Cela suggère que la robustesse face aux changements de distribution vient de la variété des stratégies gagnantes, et pas seulement du taux de succès en domaine. Pour les équipes qui déploient des VLA, cela donne un levier concret : optimiser explicitement la couverture des modes de succès plutôt que de supposer qu'elle émerge seule. Les chiffres demandent toutefois de la prudence. Le gain sur π0.5, le modèle le plus robuste au départ, n'est que de 2,0 points. L'effet semble donc se réduire à mesure que la politique de base s'améliore. Les +9,2 points sur robot réel proviennent d'une seule plateforme, à la bonne vitesse de reproduction. L'article ne donne ici ni nombre d'essais ni détail des perturbations OOD, ce qui limite la portée de la conclusion que le gain persiste en déploiement physique. Il s'agit d'un preprint, sans évaluation par les pairs.
Ce travail s'inscrit dans la montée du RL post-entraînement pour les VLA. Les politiques comme π0 et π0.5 de Physical Intelligence sont d'abord apprises par imitation à grande échelle. Le RL en boucle fermée sert ensuite à corriger leurs erreurs et à dépasser les démonstrations. Sa limite connue est une généralisation fragile : les politiques s'affinent sur la distribution d'entraînement, puis cèdent dès que la scène, l'éclairage ou les objets changent. Les benchmarks utilisés, LIBERO-Plus pour les perturbations, ManiSkill3 pour la simulation GPU parallèle et RoboTwin 2.0 pour la manipulation bimanuelle, sont devenus des références pour mesurer cet écart. DRIVE rejoint les approches qui cherchent à rendre ce RL plus robuste, sans modifier l'architecture des modèles. Les prochaines étapes à surveiller sont des tests sur des tâches plus longues, des modèles plus larges et d'autres plateformes. Le code et les protocoles d'évaluation physique détaillés permettront de juger si le gain tient hors du laboratoire des auteurs.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




