Guidage par imitation dans l'espace des tâches pour un apprentissage par renforcement efficace
TIGER (Task-Space Imitation Guidance for Efficient Reinforcement Learning) est un cadre de construction de récompense et de préentraînement pour la manipulation robotique sur table avec récompense éparse, publié sur arXiv en octobre 2026 (2610.07527). Son idée centrale est de ne pas utiliser la politique d'imitation, qui prédit des séquences d'actions (action chunks), comme contrôleur ni comme prior d'actions. Elle sert d'estimateur local de progression dans l'espace de la tâche. Les chunks prédits sont convertis, via une correspondance action-mouvement qui tient compte du contrôleur, en références d'effecteur final à court horizon. L'agent RL reçoit alors des récompenses denses de progression vers ces références, tandis que la récompense éparse de l'environnement reste l'objectif dominant. Pendant le préentraînement, des signaux d'anticipation issus de l'imitation assouplissent les pénalités de valeur conservatrices pour les actions censées faire progresser la tâche. Cela limite l'exploration hors de la distribution des données au début de l'apprentissage en ligne. Les auteurs annoncent, en simulation et sur robot réel, une meilleure efficacité d'échantillonnage initiale et moins de violations de sécurité mesurées, avec un taux de succès final égal ou supérieur aux baselines RL et IL-RL.
L'intérêt tient au point faible de l'apprentissage par renforcement sur robot physique : le coût en interactions et le risque de casse pendant l'exploration. Comme la politique d'imitation n'est jamais exécutée, ses erreurs ne plafonnent pas la performance finale. Elle ne fait que guider la récompense, ce qui limite le risque d'enfermer l'agent dans les défauts des démonstrations. Pour un intégrateur, une phase d'adaptation en ligne plus courte et plus sûre se traduit directement en temps de mise en service. Il faut toutefois relativiser. Le résumé ne donne aucun chiffre (gain d'échantillons, taux de succès, nombre de violations), ne nomme ni robot ni tâches, et se limite à des scénarios sur table. On ne peut donc pas juger l'ampleur du gain ni sa portée au-delà de ces tâches.
Ce travail s'inscrit dans le courant qui cherche à combiner imitation et RL. Les modèles VLA entraînés par imitation, comme Pi-0, plafonnent en précision et en robustesse, et le RL en ligne reste la voie principale pour dépasser ce plafond. Les approches concurrentes incluent le RL résiduel, l'ajustement fin de politiques de diffusion et les méthodes hors ligne vers en ligne à pénalités conservatrices. TIGER vise surtout la phase de transition de ces dernières. Les prochaines étapes naturelles seraient des horizons plus longs, la manipulation mobile et des tâches à contacts riches, mais le résumé n'annonce ni code ni calendrier.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




