TacDyn-WAM : apprentissage de la dynamique tactile implicite dans un modèle du monde et d'actions visuo-tactile hétérogène
Des chercheurs publient TacDyn-WAM, un « world action model » visuo-tactile hétérogène (arXiv 2610.00638) qui prédit la dynamique tactile implicite plutôt que de reconstruire les futures images tactiles. Les world action models conditionnent les actions du robot sur des futurs prédits. Leurs variantes tactiles actuelles reprennent les pipelines de génération vidéo, avec reconstruction itérative par débruitage. TacDyn-WAM apprend TacRep, un espace de représentation tactile entraîné par prédiction spatio-temporelle masquée sur des séquences tactiles, et régularisé par distillation de structure relationnelle. Deux experts, l'un visuel, l'autre tactile, prédisent des représentations futures dans des espaces cibles distincts et échangent par attention conjointe. L'expert tactile prédit, en une seule passe avant, les représentations futures et leurs variations à plusieurs horizons. Une mémoire tactile en lecture seule fournit l'état de contact courant. Sur le benchmark UniVTAC, le modèle atteint 81,5 % de réussite moyenne avec les seules démonstrations fournies. Sur cinq tâches réelles, il obtient 71,0 %, et 85,0 % après un pré-entraînement de taille modeste.
L'enjeu porte sur la robustesse en déploiement. Les auteurs soutiennent qu'un léger décalage de position ou de force de contact modifie fortement les pixels tactiles, alors que l'évolution du contact reste prévisible. Reconstruire ces pixels devient alors fragile, tandis que prédire la dynamique dans un espace latent y serait moins sensible. Le résultat est notable pour les intégrateurs de manipulation fine, par exemple l'insertion ou la saisie sous contact, car il suggère qu'un tactile utile ne demande pas forcément de lourds modèles génératifs. Le modèle reste compétitif face à des approches pré-entraînées sur de vastes trajectoires visuo-tactiles. Les ablations indiquent que les deux voies tactiles et TacRep l'emportent sur les alternatives par reconstruction de pixels ou statiques. Les chiffres viennent toutefois des auteurs, sur un benchmark, avec un nombre limité de tâches réelles. Le papier ne donne ni temps de cycle ni matériel de déploiement industriel, et l'écart entre simulation, laboratoire et production reste à démontrer.
Ce travail s'inscrit dans la montée des modèles du monde appliqués au contrôle robotique, où le tactile reste le parent pauvre face à la vision. Les VLA comme Pi-0 ou GR00T s'appuient surtout sur la vision et le langage, tandis que les capteurs tactiles de type vision-based (GelSight et dérivés) restent peu intégrés aux modèles de fondation. Les variantes tactiles concurrentes héritent des architectures de génération vidéo que TacDyn-WAM remet en cause. Il s'agit d'une prépublication v1, sans produit ni déploiement annoncé. La suite probable passera par des pré-entraînements plus vastes, davantage de tâches réelles et une réplication indépendante. Aucun acteur français ou européen n'est cité dans l'article.
Dans nos dossiers




