Passage à l'échelle de l'apprentissage de récompense vision-langage pour la manipulation robotique en simulation parallèle
Des chercheurs publient RAPID (Reward learning with Adaptive Parallel Image Diversity) sur arXiv (2609.21767, fin septembre 2026), un système qui accélère l'apprentissage de récompense par préférences où des modèles vision-langage remplacent les annotateurs humains. Il combine rollouts parallélisés sur GPU, mises à jour de politique adaptatives, étiquetage de préférences en une seule requête API, stabilisation automatique de la récompense et échantillonnage d'images représentatives. Testé sur cinq tâches de manipulation avec un bras Franka Panda dans le simulateur IsaacLab, il réduit d'abord le temps d'entraînement moyen de 9,18 à 3,13 heures via la seule parallélisation. Tous composants activés, l'entraînement complet tombe à 1,15 heure, avec 896 appels API au lieu de 19 840 par run (-95,5%), et le taux de réussite agrégé grimpe de 86,3% à 98,7%, pour un gain global de 8 fois. Une évaluation hors ligne avec Gemma 3 12B et GPT-4.1 mini confirme les gains de latence et de coût. Le code est publié sur GitHub (rapid-vlm/rapid-vlm-rl).
Ce travail cible un goulot d'étranglement identifié dans le secteur: utiliser un VLM comme juge de préférences pour entraîner des politiques de manipulation multiplie les appels API et le temps de simulation, rendant cet apprentissage par renforcement trop coûteux pour un usage industriel à grande échelle. En montrant qu'une refonte architecturale (parallélisation, réduction des requêtes, sélection d'images pertinentes) divise le coût en API par vingt et le temps d'entraînement par huit tout en améliorant le taux de succès, RAPID ouvre une voie vers un entraînement guidé par VLM viable hors des laboratoires aux budgets de calcul massifs, un enjeu pour les intégrateurs cherchant à adapter rapidement des politiques à de nouvelles tâches.
L'apprentissage par préférences existe depuis plusieurs années en robotique, mais reposait historiquement sur des annotateurs humains, lents et coûteux à mobiliser. Le recours à des VLM comme GPT-4.1 mini ou Gemma 3 12B pour juger des paires de trajectoires s'inscrit dans la tendance du "LLM-as-judge" appliquée à la robotique. RAPID se positionne comme une optimisation système plutôt qu'un nouvel algorithme de récompense, en s'attaquant à la latence des requêtes séquentielles et à la collecte de données limitée à un seul environnement, deux freins pratiques à l'adoption. Le code publié par les auteurs permettra à d'autres équipes de reproduire les résultats sur IsaacLab et d'étendre l'évaluation au-delà du bras Franka Panda utilisé ici.
Dans nos dossiers




