TacZero : insertion de cheville sans entraînement grâce à un modèle vision-langage généraliste et un retour tactile
Des chercheurs proposent TacZero, un cadre qui confie à un modèle vision-langage (VLM) généraliste pré-entraîné, sans aucun entraînement tactile ni manipulation supplémentaire, le pilotage d'une tâche d'insertion de cheville cylindrique (peg-in-hole). Le VLM reçoit les images de caméra, l'état du robot et les réponses tactiles à trois axes, présentées soit sous forme de valeurs numériques, soit sous forme de vecteurs superposés aux images. À partir de ces observations et de l'historique des interactions, il génère des commandes précisant les positions cibles de l'effecteur et l'ouverture ou la fermeture de la pince, qu'un contrôleur bas niveau exécute. Aucune règle spécifique à la tâche n'est codée pour interpréter le contact ou choisir les actions. Lors d'essais réels, TacZero a réussi 15 insertions sur 20 avec un retour tactile numérique, contre 10 sur 20 sans toucher. Le travail a été publié sur arXiv (2610.07621, première version).
L'intérêt tient à l'approche plus qu'au score. Les méthodes antérieures reposent soit sur des modèles d'estimation de contact et des lois de commande tactile conçus à la main, soit sur des modèles appris à partir de données tactiles pour estimer le mouvement des objets, prédire l'effet des actions et sélectionner ces dernières. TacZero suggère qu'un VLM généraliste peut raisonner sur le contact sans cette infrastructure, ce qui, si cela se confirme, réduirait fortement le coût de mise en place de nouvelles tâches riches en contact. Il faut toutefois relativiser. L'échantillon est minuscule (20 essais par condition), la tâche est simple et la différence de cinq succès n'a pas de robustesse statistique démontrée. Les auteurs ne donnent ni temps de cycle ni comparaison avec des politiques apprises, et eux-mêmes parlent d'un « point de départ » qui met en évidence des difficultés. Le résultat n'indique donc pas que la manipulation tactile est résolue par les VLM, seulement que le toucher apporte un gain mesurable dans ce cadre.
Ce travail s'inscrit dans la montée des modèles vision-langage-action (VLA) comme Pi-0, Helix ou GR00T, qui apprennent la manipulation à partir de grandes quantités de démonstrations, mais intègrent encore peu et mal le tactile. TacZero prend le chemin inverse : un modèle généraliste utilisé tel quel, sans réentraînement. L'insertion de cheville reste un banc d'essai classique de l'assemblage industriel, où les approches actuelles dépendent de contrôle en force réglé à la main ou d'apprentissage par renforcement. Les prochaines étapes naturelles seraient des géométries plus variées, des tolérances plus serrées, davantage d'essais et une mesure de la latence d'un VLM dans la boucle de commande, point critique pour tout usage en atelier.
Dans nos dossiers




