La curiosité tactile stimule l'interaction des robots avec leur environnement
Des chercheurs publient sur arXiv (2609.40134) TacEx, un cadre d'apprentissage par renforcement (RL) qui utilise le toucher comme moteur de curiosité pour l'exploration robotique. Le principe : décomposer l'incertitude épistémique d'un modèle du monde par modalité sensorielle, puis orienter la récompense intrinsèque vers le canal tactile. Le robot est ainsi incité à chercher les transitions de contact plutôt que les mouvements dans le vide. Selon les auteurs, l'agent apprend à saisir et manipuler des objets sans récompense de tâche ni démonstration experte pendant l'exploration. Le jeu de données ainsi collecté, dense en interactions, sert ensuite à entraîner hors ligne des politiques de pick-and-place, sans nouvelle interaction avec l'environnement. L'équipe applique aussi la méthode au post-entraînement de modèles vision-langage-action (VLA) pré-entraînés sans retour tactile. Elle annonce une amélioration substantielle des performances, avec une grande efficacité en échantillons. Le résumé ne fournit ni taux de réussite, ni nombre d'étapes d'entraînement, ni modèles VLA précis, ni capteurs tactiles utilisés. On ignore aussi si les résultats viennent de la simulation ou de robots physiques.
Le problème visé est un goulot d'étranglement connu : la plupart des algorithmes de RL explorent par échantillonnage aléatoire d'actions et dépensent l'essentiel de leur budget en mouvements dans l'espace libre, loin des contacts d'où naissent les compétences de manipulation. Les méthodes de motivation intrinsèque fondées sur le désaccord entre modèles ou l'incertitude épistémique font mieux que le bruit isotrope, mais elles peuvent récompenser des transitions sans intérêt fonctionnel, comme des gestes erratiques. Pour un intégrateur, l'enjeu est la réduction du coût de collecte de données et de mise au point d'une cellule de manipulation. L'intérêt pratique est aussi de pouvoir enrichir des VLA existants avec le toucher sans repartir d'un pré-entraînement complet. Cela irait dans le sens d'un constat croissant : la vision seule plafonne sur les tâches riches en contacts. Les gains restent toutefois à vérifier sur du matériel réel, face à des bases de référence solides.
Le travail s'inscrit dans la montée des modèles VLA (Pi-0, GR00T, Helix) qui dominent la manipulation généraliste, mais restent peu sensibles au toucher. Il s'inscrit aussi dans un courant de recherche sur l'exploration par curiosité et les modèles du monde. À ce stade, il s'agit d'un préprint non évalué par des pairs (v1), sans produit ni déploiement associé. La suite logique est une validation sur robots physiques, sur davantage de tâches, et une comparaison avec les autres approches de post-entraînement de VLA, notamment par RL.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




