
VT-MUSE : apprentissage séquentiel unifié de représentations visuotactiles multimodales pour la manipulation
Un preprint publié en août 2026 sur arXiv (2608.21290) décrit VT-MUSE, un framework en deux étapes pour l'apprentissage de représentations visuotactiles en manipulation robotique. La première étape aligne conjointement des encodeurs vision et toucher par alignement temporel cross-modal et cohérence sur vues masquées. La seconde combine un modèle latent variationnel conditionnel avec des séquences visuelles partiellement masquées et l'historique tactile complet, via des décodeurs auxiliaires qui reconstruisent les images manquantes et prédisent les variations de profondeur tactile ; la représentation obtenue alimente une politique Transformer légère par attention croisée à portes. Sur le benchmark de simulation retenu, VT-MUSE dépasse la meilleure méthode concurrente de 11 points de pourcentage sur toutes les tâches testées, avec des gains également substantiels en conditions réelles, non chiffrés.
Le papier cible un angle mort connu de la manipulation robotique : la plupart des méthodes visuotactiles fusionnent tardivement des flux vision et toucher encodés séparément, limitant les corrélations fines entre modalités, et négligent l'évolution temporelle du contact au profit du seul instant présent. Pour des gestes sensibles comme l'insertion de précision, la préhension d'objets fragiles ou le contrôle de force en assemblage, c'est pourtant cette dynamique dans le temps qui conditionne la réussite du geste. Le résultat conforte l'idée que les politiques d'action de type VLA gagnent en robustesse quand le tact est traité comme un signal temporel structuré, même si le gain de 11 points reste mesuré face à une seule baseline sur un benchmark propre à l'étude, et la validation réelle demeure peu détaillée.
VT-MUSE s'inscrit dans une recherche plus large visant à traiter le signal tactile avec la même rigueur temporelle que la vision, aux côtés d'architectures génériques comme Pi-0 ou GR00T N2 qui restent, elles, centrées sur la vision et le langage. Sa contribution tient à l'alignement conjoint des modalités dès l'encodage et à la modélisation explicite de l'historique tactile complet, là où les approches existantes fusionnent des flux traités indépendamment. S'agissant d'un preprint tout juste mis en ligne, la suite logique passe par la publication du code et une évaluation sur des tâches et plateformes robotiques plus variées, préalable à toute adoption par des intégrateurs industriels.
Dans nos dossiers




