TOPReward : les probabilités de tokens comme récompenses cachées zéro-shot pour la robotique
TOPReward est une méthode d'apprentissage robotique sans entraînement dédié, conçue pour générer des signaux de récompense denses et fondés sur l'instruction donnée au robot. Contrairement aux approches existantes, qui reposent sur des annotations manuelles de progression, des démonstrations spécifiques à chaque tâche, ou des modèles de récompense entraînés sur des jeux de données robotiques triés, TOPReward exploite directement les probabilités de tokens internes de modèles Video-Language (VLM) déjà pré-entraînés. Concrètement, la méthode fournit au VLM un extrait vidéo et une instruction en langage naturel, puis mesure la probabilité que le modèle attribue au fait que la tâche soit terminée, plutôt que de lui demander de générer une valeur numérique de progression. Les chercheurs évaluent leur approche sur ManiRewardBench, un benchmark de manipulation en conditions réelles qu'ils ont construit, couvrant 130 tâches uniques sur quatre plateformes robotiques distinctes, ainsi que sur les jeux de données Open X-Embodiment. TOPReward surpasse nettement les méthodes VLM sans entraînement existantes sur les modèles open source, et se montre compétitif face à un modèle de récompense entraîné spécifiquement, sur les métriques d'estimation de progression, sans nécessiter le moindre entraînement dédié.
Pour l'industrie robotique, l'enjeu central reste l'obtention de feedback fiable à grande échelle sans coûteuse collecte et annotation manuelle propre à chaque tâche. Si un VLM générique, non spécialisé, parvient à distinguer une tâche réussie d'un comportement bloqué ou raté, cela allège considérablement le travail des équipes qui veulent déployer de l'apprentissage par renforcement ou du clonage de comportement sur de nouvelles tâches sans repasser par une phase d'étiquetage. Les auteurs précisent que le signal reste sensible à l'instruction donnée et n'est pas simplement expliqué par la position temporelle dans la vidéo, un point qui écarte l'hypothèse que le modèle se contente de suivre le déroulé de la séquence sans réellement évaluer l'accomplissement de la tâche.
Ce travail s'inscrit dans la lignée des recherches cherchant à remplacer les reward models spécialisés par des modèles vision-langage généralistes, une piste motivée par le coût et la rigidité des modèles entraînés sur mesure pour chaque robot. TOPReward se distingue des méthodes VLM précédentes, qui demandaient au modèle de produire explicitement un score numérique, une approche jugée peu fiable car les VLM restent mal calibrés pour ce type de sortie. Le papier, disponible sur arXiv (2602.19313v2, version révisée), démontre deux applications en aval : la détection de succès de tâche et le clonage de comportement pondéré par récompense en mode offline. Reste à confirmer si l'approche tient à plus grande échelle, sur des tâches de manipulation plus complexes que celles couvertes par ManiRewardBench.
Dans nos dossiers




