TaRL : apprendre des récompenses générales et physiques à partir de démonstrations tactiles
Des chercheurs de l'équipe EmbodiedAI de la NTU (Nanyang Technological University) proposent TaRL (Tactile Reward Learning), un cadre qui apprend des fonctions de récompense à partir de démonstrations tactiles, pour l'apprentissage par renforcement (RL) de tâches de manipulation riches en contacts. Le système prend en entrée une séquence de cartes de déformation tactile et régresse un indice d'avancement de la tâche, en s'entraînant à la fois sur des démonstrations réussies et sur des échecs. Il a été évalué sur quatre tâches en simulation et deux en conditions réelles. Utilisé comme récompense de guidage (reward shaping), il améliore l'efficacité d'échantillonnage et le taux de succès final : sur l'enfilage d'écrou (nut threading), le succès passe de 34 % à 56 % en simulation, et sur le ramassage d'un cube, de 37 % à 97 % sur robot réel. Combiner récompenses tactiles et visuelles améliore encore les résultats. Un modèle entraîné sur le placement de boîtes a aussi été déployé directement sur le placement de canettes, avec un gain notable sur l'apprentissage de cette nouvelle tâche.
L'intérêt tient à un verrou bien connu du RL : les récompenses éparses ralentissent l'apprentissage, et les récompenses denses sont difficiles à spécifier à la main. Les approches par récompense visuelle, apprises à partir de démonstrations sans actions, contournent le problème, mais elles ne voient que les objectifs visibles. Or beaucoup de tâches de manipulation dépendent de ce que la caméra ne capte pas : fermeté d'une prise, direction et intensité des forces appliquées. Le signal tactile décrit l'interaction locale entre robot et objet, ce qui le rend aussi robuste aux changements de disposition de la scène, comme la position de l'objet. Pour les intégrateurs, c'est une piste pour réduire l'ingénierie de récompenses sur des tâches d'assemblage ou d'insertion. Le saut de 37 % à 97 % est frappant, mais il porte sur une tâche simple, un seul cube, et ne dit rien de la tenue sur des pièces industrielles variées. Les résultats restent ceux d'un article préprint, sans validation indépendante ni test en cadence de production.
Ce travail s'inscrit dans la montée des capteurs tactiles à base de déformation (type GelSight) et de l'apprentissage de récompenses à partir de vidéos, où la vision domine encore. Il complète les politiques vision-langage-action (VLA), majoritairement visuelles, qui peinent sur les tâches où la force compte. Le gain en généralisation d'un objet à l'autre reste à confirmer sur des catégories plus éloignées. Les prochaines étapes probables sont des tâches à plus fort contact, des capteurs différents et une intégration avec des modèles de fondation. Le code et la page projet sont annoncés, ce qui permettra à d'autres laboratoires de reproduire les chiffres.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




