Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage
Des chercheurs proposent les Large Reward Models (LRM), un cadre qui transforme des modèles vision-langage (VLM) de base en générateurs de récompense image par image, destinés à affiner des politiques de manipulation robotique. Le VLM de pointe retenu est spécialisé sur un jeu de données multi-sources : trajectoires de robots réels, interactions humain-objet et environnements de manipulation simulés. Contrairement aux approches qui évaluent les trajectoires a posteriori, les LRM exposent trois interfaces de récompense à partir des seules observations visuelles : estimation de progression, détection d'achèvement de la tâche et comparaison contrastive temporelle. Partant d'une politique apprise par imitation (IL), les auteurs utilisent ces signaux pour guider un affinage par PPO sur des tâches de manipulation à long horizon non vues pendant l'entraînement. La récompense de progression s'impose comme le meilleur signal en ligne sans information privilégiée : elle améliore la politique IL de référence et réduit l'écart avec les récompenses « privilégiées » issues de l'état interne de l'environnement. Côté matériel réel, elle sert à pondérer un clonage comportemental (behavioral cloning) selon la progression, sur quatre tâches de manipulation et deux plateformes robotiques, avec un gain sur le fine-tuning supervisé (SFT) classique dans les quatre cas. Le résumé ne donne ni modèle de VLM, ni taux de réussite chiffrés, ni noms de robots.
L'enjeu est celui d'un goulot d'étranglement bien connu : l'apprentissage par renforcement (RL) peut améliorer les politiques de manipulation, mais écrire une fonction de récompense à la fois sémantiquement pertinente et réutilisable d'une tâche à l'autre reste coûteux, et se fait aujourd'hui surtout à la main, tâche par tâche. Si ces résultats se confirment, un VLM spécialisé pourrait servir de récompense générique, ce qui réduirait l'ingénierie de récompense pour les intégrateurs et ouvrirait la voie à une auto-amélioration des robots en déploiement, sans instrumentation de la scène. Des réserves s'imposent : l'écart avec les récompenses privilégiées est réduit, pas comblé ; la validation réelle ne porte que sur quatre tâches, et sur du clonage comportemental pondéré plutôt que sur du RL en ligne sur robot physique. Le travail relève de la recherche (preprint arXiv, version 3), sans produit ni déploiement industriel.
Ces travaux s'inscrivent dans la montée des modèles de fondation pour la robotique, des VLA (vision-langage-action) comme Pi-0 ou GR00T aux VLM utilisés comme juges ou générateurs de récompense. Les approches précédentes de récompense par modèle de langage ou de vision restaient souvent limitées à une évaluation après coup, ce que les LRM cherchent à dépasser avec un signal exploitable en ligne. La suite logique serait de tester ces récompenses en RL directement sur robot réel, sur un plus grand nombre de tâches, et de mesurer leur robustesse face aux erreurs d'estimation de progression, qui peuvent être exploitées par la politique. Le résumé ne cite aucun acteur européen ni partenaire industriel.
Dans nos dossiers




