Imagine-RL : cross-attention guidée par la confiance résiduelle pour l'apprentissage par renforcement VLA augmenté par modèle du monde
Un preprint arXiv publie ce mois-ci (référence 2609.24033) présente Imagine-RL, une méthode de post-entrainement par renforcement pour les politiques Vision-Language-Action (VLA), destinée a la manipulation robotique riche en contacts. Le système associe une politique VLA figée a un modèle du monde latent visuel-couple (VTLWM), lui aussi gelé, qui prédit de manière autoregressive de futures représentations compactes sans reconstruction pixel par pixel. Une requête image-état-action croise l'historique observe et ces futurs prédits, les résidus de prédiction de la fenêtre précédente servant de priors de confiance qui écartent les prédictions peu fiables, pour que le critique juge chaque action candidate selon ses conséquences anticipées. Sur quatre taches robotiques réelles a 50 essais chacune, la méthode n'utilise que 100 trajectoires de renforcement et améliore le taux de réussite moyen de 23,6% face a DSRL et de 60% face aux politiques VLA de base.
Ce résultat cible une faiblesse connue des méthodes de RL en espace de bruit, qui pilotent des politiques VLA figées sans reentrainement complet : leurs critiques jugent généralement l'action a partir de la seule observation présente, aveugles aux conséquences physiques futures, ce qui pénalisé les taches a fort contact comme l'insertion ou l'assemblage. Un gain de réussite de 60% obtenu avec seulement 100 trajectoires réelles, sans reentrainer la politique VLA ni le modèle du monde, ouvre une piste de spécialisation peu couteuse pour les intégrateurs qui veulent adapter des politiques généralistes a du matériel réel sans multiplier la collecte de données. L'approche s'inscrit dans une tendance de la recherche robotique a coupler modèles du monde et politiques VLA pour réduire l'écart entre simulation et performance réelle, sur un périmètre pour l'instant limite a quatre taches et 50 essais chacune.
Le travail prolonge les méthodes de RL en espace de bruit destinées a affiner des politiques VLA preentrainees sans toucher a leurs poids, DSRL servant ici de référence de comparaison directe. Il y ajoute un modèle du monde spécialisé sur les signaux visuels et de couple, plutôt qu'un modèle génératif pixel, pour rendre exploitable la projection dans le futur sans reentrainement de bout en bout. Le preprint ne précise ni la politique VLA de base ni les taches exactes évaluées, et aucun déploiement industriel n'est annonce : il s'agit d'une contribution de recherche dont la reproductibilité sur d'autres politiques reste a établir.
Dans nos dossiers




