TACIT : la supervision par contact tactile guide l'attention spatiale en manipulation dextérique
Une équipe de recherche publie TACIT (Tactile Contact Informs Attention), une méthode qui utilise les contacts tactiles mesurés pendant des démonstrations téléopérées pour superviser l'attention spatiale de politiques visuomotrices de manipulation, sans annotation de points supplémentaire. Décrite dans un article déposé sur arXiv (2609.24507v1), la méthode place des cibles gaussiennes sur les nuages de points de caméra précédant le contact pour entraîner une tête d'attention, dont la sortie agrégée conditionne une politique de diffusion visuotactile ; ces cibles ne servent qu'à l'entraînement, le signal tactile restant une entrée au moment de l'inférence. Sur le banc d'essai principal, avec dix démonstrations par tâche et cinq zones de placement différentes, TACIT atteint 66,7% de réussite sur une tâche de placement de balle et 73,3% sur une tâche d'insertion de goupille, contre respectivement 10,0% et 20,0% pour une fusion visuotactile 3D à entrées équivalentes, et 20,0% et 43,3% pour la politique vision seule DP3. Sur les 30 essais de chaque tâche, TACIT atteint systématiquement la zone d'approche à 150 mm de l'objet en moins de 12 secondes, tous les échecs restants survenant après cette arrivée.
Ce résultat cible un problème connu de l'apprentissage par imitation à partir de peu de démonstrations : les politiques entraînées sur un faible nombre d'exemples ont tendance à rejouer des trajectoires figées plutôt qu'à suivre réellement la position changeante des objets. En s'appuyant sur un signal déjà présent dans les données de téléopération plutôt que sur des annotations humaines ou des modèles de vision externes pour définir les priors spatiaux, TACIT réduit le coût de collecte de données pour les intégrateurs travaillant sur des piles de manipulation few-shot. Le fait que les échecs surviennent après l'arrivée sur zone, et non pendant l'approche, indique que la méthode résout spécifiquement le ciblage spatial, pas la saisie ou la manipulation fine elle-même.
L'étude s'inscrit dans le champ des politiques de diffusion et de l'apprentissage visuomoteur par imitation, confronté à la généralisation à partir de peu de démonstrations. Les comparaisons incluent DP3, une politique de diffusion 3D vision seule, une fusion visuotactile à entrées équivalentes, et un contrôle à architecture identique sans supervision d'attention explicite, afin d'isoler la contribution propre du signal tactile. Les tests, menés sur robot réel pour la tâche de balle et en simulation pour l'insertion de goupille sur trois graines d'entraînement, restent un travail de recherche académique sans déploiement commercial ni plateforme nommée, les auteurs limitant eux-mêmes leurs conclusions à l'espace de travail évalué.
Dans nos dossiers




