VLaRL : enrichir les modèles vision-langage-action grâce à un apprentissage par renforcement résiduel entraîné en simulation
Une équipe de recherche a publié fin septembre 2026 sur arXiv (2609.30868) un article décrivant VLaRL, une méthode qui ajoute une correction par apprentissage par renforcement (RL) résiduel aux modèles vision-langage-action (VLA), sans réentraîner le VLA lui-même, qui reste gelé. Contrairement au RL résiduel classique, entraîné directement sur robot réel donc coûteux et risqué en sécurité, VLaRL entraîne sa politique correctrice entièrement en simulation puis la déploie sur robot réel sans RL en ligne ni adaptation supplémentaire. Pour franchir l'écart visuel entre simulation et réalité, la méthode conditionne la politique résiduelle sur la représentation latente interne vision-langage du VLA plutôt que sur l'image brute, et ajoute un module léger qui reprojette les latents simulés vers la distribution des latents réels. Testée sur quatre tâches de manipulation à fort contact avec deux architectures VLA différentes, VLaRL améliore le taux de réussite en conditions réelles dans toutes les combinaisons tâche/modèle, et des ablations contrôlées confirment l'apport à la fois du conditionnement latent et de son alignement.
Le problème visé est bien connu de l'industrie : les VLA généralistes, du type Pi-0, GR00T N2 ou Helix, exécutent des instructions larges mais restent souvent imprécis dès que la tâche exige un contact fin, une insertion ou un assemblage. La solution habituelle, le RL résiduel entraîné sur robot réel, mobilise du temps d'ingénierie et expose le robot à des phases d'exploration risquées en usine. En montrant qu'un correctif entraîné uniquement en simulation se transfère sans RL en ligne ni adaptation, VLaRL ouvre une voie moins coûteuse pour fiabiliser des VLA déjà déployés, sans toucher au modèle de base ni ajouter d'exposition au risque, un argument qui parle directement aux intégrateurs cherchant à combler l'écart entre démonstration et production.
Les VLA se sont imposés depuis deux ans comme approche dominante pour piloter bras robotiques et humanoïdes par instructions en langage naturel, mais leur adoption industrielle bute sur cet écart persistant entre démonstration et fiabilité en conditions réelles. Le RL résiduel était déjà étudié comme correctif, mais son coût en robot réel en freinait le déploiement à grande échelle ; VLaRL s'inscrit dans la lignée des travaux sur le transfert sim-to-real, en misant sur l'espace latent plutôt que sur le rendu visuel pour réduire cet écart. L'article reste à ce stade un résultat de recherche en préprint, validé sur un nombre limité de tâches et d'architectures, sans partenariat industriel ni calendrier de déploiement pilote annoncé.
Dans nos dossiers




