τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future
Un article publié sur arXiv (référence 2607.24485v1, catégorie "new") présente τ (tau), un framework qui enrichit les modèles Vision-Language-Action (VLA) avec une représentation tactile spatio-temporelle conditionnée par l'action. La méthode s'inspire du JEPA (Joint-Embedding Predictive Architecture) : elle apprend cette représentation en prédisant les futures observations visuelles à partir du signal tactile, puis fusionne cette information avec les caractéristiques vision-langage pour générer les actions du robot. Cette supervision opère uniquement dans l'espace latent et pendant l'entraînement, sans surcoût au moment du déploiement. Les auteurs publient également TacAura, un jeu de données synchronisant vision, proprioception et signaux tactiles à base de capteurs visuels, collecté sur quatre tâches de manipulation impliquant des contacts riches.
L'enjeu est la sous-exploitation du toucher dans les modèles VLA actuels, qui reposent majoritairement sur la vision et le langage, ou au mieux sur une détection binaire de contact ou des séquences de torseurs 6D, insuffisantes pour exploiter des signaux tactiles haute dimension. Le papier s'attaque frontalement au problème de rareté des données : les démonstrations spécifiques à une tâche sont limitées, tandis qu'un pré-entraînement tactile à grande échelle reste coûteux. En montrant qu'une supervision auto-supervisée de type JEPA permet d'extraire une représentation tactile exploitable avec peu de données, l'étude touche à un débat central du secteur, celui de l'efficacité des données pour des tâches de manipulation fine (insertion, préhension d'objets déformables) où la seule vision atteint ses limites, un enjeu direct pour les intégrateurs industriels visant l'assemblage de précision.
Ce travail s'inscrit dans la lignée des modèles VLA généralistes (Pi-0, GR00T N2, Helix) qui combinent perception et langage pour piloter des robots, mais qui ont historiquement négligé le tactile faute de capteurs standardisés et à cause du coût de collecte. Les auteurs comparent τ à des approches existantes centrées sur les états de contact instantanés, et démontrent une meilleure généralisation à des objets et scènes inédits. Il s'agit à ce stade d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenariat commercial.
Dans nos dossiers



