Modèles de récompense résiduels : exploiter les connaissances a priori pour un apprentissage par renforcement basé sur les préférences efficace en robotique
Les chercheurs proposent les Residual Reward Models (RRM), une méthode d'apprentissage par renforcement basé sur les préférences (PbRL) destinée à réduire le volume de retours humains nécessaires pour entraîner des robots. Publié sur arXiv (2507.00611v2), le papier part d'un constat pratique: le PbRL classique apprend une fonction de récompense à partir de démonstrations puis l'affine avec des préférences humaines, mais le passage d'une fonction de perte à l'autre pendant l'entraînement d'un réseau de neurones déstabilise souvent l'optimisation et dégrade les performances. L'idée du RRM est de décomposer la récompense réelle de l'environnement en deux termes: une récompense a priori, fixée avant l'entraînement (heuristique d'ingénierie, récompense générée par un modèle de langage, ou fonction apprise par apprentissage par renforcement inverse), et une récompense résiduelle apprise ensuite à partir des préférences humaines. Les auteurs valident l'approche sur les bancs d'essai en simulation Meta-World et DM-Control, puis sur un robot physique Franka Panda, où la méthode accélère l'apprentissage de politiques et atteint des taux de réussite élevés en moins d'étapes que les méthodes de référence.
Pour l'industrie robotique, ce travail s'attaque directement au goulot d'étranglement du PbRL: le coût et le volume de feedback humain nécessaires pour spécifier des comportements complexes sans concevoir manuellement des fonctions de récompense fragiles. En montrant un gain de sample efficiency sur plusieurs types de récompenses a priori et sur un bras robotique réel, l'étude appuie l'idée que combiner connaissances préalables (heuristiques, LLM, apprentissage inverse) et apprentissage par préférences peut rendre l'entraînement de politiques robotiques plus praticable hors laboratoire, un enjeu clé pour les intégrateurs qui cherchent à réduire le temps d'ingénierie de récompense avant déploiement.
Ce travail s'inscrit dans la lignée des recherches en RLHF appliqué à la robotique, où l'instabilité liée aux changements de fonction de perte entre phases d'entraînement est un problème documenté. Le choix de Meta-World et DM-Control comme bancs d'essai standards, complété par une validation sur un Franka Panda physique, positionne cette contribution comme un travail académique avec preuve de concept matérielle plutôt qu'un produit commercial. Le papier ne mentionne ni partenaire industriel ni feuille de route de déploiement; il reste, à ce stade, une contribution méthodologique destinée à d'autres chercheurs en apprentissage par renforcement et en robotique.
Dans nos dossiers




