PredTac : apprentissage de la manipulation en contact riche par prédiction du toucher
Des chercheurs présentent PredTac, un cadre qui remplace les capteurs tactiles physiques par une estimation visuelle du contact lors de la manipulation robotique. Le système entraîne d'abord un prédicteur tactile supervisé par des données de contact réelles, puis utilise ses inférences comme substitut au toucher mesuré pendant l'apprentissage et l'exécution de politiques, à partir de simples observations visuelles et de l'état du robot. L'équipe teste PredTac sur trois tâches à fort contact, en simulation et sur robot réel : insertion USB, extraction d'un objet barbelé (Barbed-spike) et rotation de vanne (Valve). En simulation, les politiques à toucher prédit atteignent 27,0%, 52,0% et 44,7% de réussite selon la tâche, soit un gain de 8,0 à 13,7 points de pourcentage par rapport à une politique purement visuelle. Sur robot réel, avec l'architecture ACT, les taux grimpent à 70,0%, 50,0% et 90,0% (moyenne de 70,0% sur les trois tâches), un score proche des 72,2% obtenus avec un toucher réellement mesuré et largement supérieur aux 21,1% d'une politique vision seule.
Ce résultat s'attaque à un point de friction connu de la robotique de manipulation fine : les capteurs tactiles physiques ajoutent du coût matériel, des contraintes de calibration, de synchronisation et de maintenance qui freinent le déploiement en dehors des laboratoires. Si le toucher peut être inféré de façon fiable à partir de la vision et de la proprioception, cela lève un obstacle matériel pour les intégrateurs qui veulent équiper des bras robotiques de compétences fines (insertion de connecteurs, manipulation d'objets irréguliers, actionnement de vannes) sans multiplier les capteurs embarqués et leurs pannes associées. Les auteurs nuancent toutefois la promesse : des tests d'intervention montrent que la performance reste sensible à la structure spatiale du contact prédit, une simple réorganisation spatiale des valeurs prédites faisant chuter le succès sur la tâche Valve de 10,7 points. Le toucher prédit n'égale donc pas encore totalement le toucher mesuré, mais s'en approche suffisamment pour être une alternative crédible plutôt qu'un pis-aller.
Ce travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) et des politiques comme ACT, qui cherchent à réduire la dépendance des robots manipulateurs à des capteurs spécialisés coûteux. Il complète les approches à toucher mesuré directement, en proposant une alternative bas coût sans capteur tactile dédié. L'étude, publiée en préprint sur arXiv le 15 septembre 2026, reste à ce stade une validation en laboratoire sur trois tâches ciblées et un unique bras robotique réel, sans indication de partenariat industriel ni de déploiement au-delà du cadre expérimental ; les prochaines étapes attendues concernent l'extension à davantage de tâches et de plateformes pour confirmer la généralisation de l'approche.
Dans nos dossiers




