DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique
DexTouch-WM, publié en preprint sur arXiv (2609.20649v1), est un modèle du monde conditionné par l'action qui prédit conjointement les images RGB futures et la dynamique tactile bilatérale pour la manipulation dextre robotique. Il s'appuie sur des réseaux de capteurs piézorésistifs flexibles montés selon un schéma identique sur des mains humaines et robotiques, rendant leurs signaux tactiles directement comparables. Le mouvement humain est retranscrit dans l'espace d'action du robot, permettant à des démonstrations tactiles humaines de superviser le même modèle de dynamique que celui utilisé sur robot réel. L'architecture associe un vidéo expert pré-entraîné à un tactile expert léger via des tokens tenant compte de l'anatomie de la main. Les auteurs fixent cinq heures de données robot réel et font varier les données tactiles humaines de zéro à cent heures.
Les tâches humaines et robotiques utilisées à l'entraînement étant disjointes, l'amélioration observée sur les prédictions visuelles, géométriques et de contact en domaine robot suggère un transfert réel des dynamiques de contact entre les deux embodiments. Cela vise le principal goulot d'étranglement de la manipulation dextre en contact riche: la collecte de données tactiles reste lente, coûteuse et liée à un capteur et un robot spécifiques. En montrant qu'une supervision tactile humaine, bien plus facile à collecter en volume, complète un budget de données robot limité, les auteurs proposent un axe de données alternatif à la téléopération ou à la simulation pure, utile pour entraîner des politiques de manipulation à plus grande échelle.
Ce travail prolonge les modèles du monde vidéo déjà employés en robotique comme substituts de simulation, en y ajoutant une dynamique tactile bilatérale explicite, un axe encore peu exploité face à la vision et au langage dans la manipulation dextre. Il se positionne face aux approches misant uniquement sur la téléopération robot ou la simulation physique pour générer des données de contact. Publié comme preprint arXiv sans annonce de déploiement, de partenariat industriel ou de calendrier commercial, il reste une contribution de recherche: les auteurs présentent l'évaluation en environnement de substitution et la génération de trajectoires synthétiques pour l'apprentissage de politiques comme des pistes ouvertes plutôt que comme un système prêt à l'emploi.
Dans nos dossiers




