VisTacAlign : co-entraînement de politiques dextériques sur des démonstrations tactiles humaines et robotiques
Un preprint arXiv (2609.30959v1), publié fin septembre 2026 avec une page projet à vis-tac-align.github.io, présente VisTacAlign, un framework de co-entraînement de politiques de manipulation dextre combinant vision 3D et tactile. Des démonstrations humaines captées par un gant tracké sont retargetées vers une main robotique tactile à 17 degrés de liberté, avec une correction ponctuelle des doigts. La main humaine est effacée des vues stéréo et remplacée par un maillage de main robot texturé à partir d'images robot réelles, puis un modèle de fondation stéréo est réappliqué sur l'image composite pour homogénéiser les erreurs de perception entre les deux sources. Un gant tactile capacitif est calibré sur les capteurs de bout de doigt du robot, et un transformeur à diffusion ingère nuage de points, proprioception et tactile par doigt. Trois tâches réelles servent de test : assemblage de Lego, cueillette de fraises de tailles variables, activation et levage d'une perceuse.
Résultat clé : combiner ces démonstrations humaines alignées avec des données robot existantes améliore les politiques par rapport à un entraînement robot seul, et les ablations montrent que tactile et alignement visuel sont chacun nécessaires. Pour les équipes de manipulation dextre, l'enjeu est économique : la téléopération robot reste lente et coûteuse à collecter, alors que les démonstrations humaines filmées à la main sont abondantes. Le verrou n'était pas le volume de données humaines mais l'écart d'incarnation entre main humaine et main robot. Ces travaux appuient l'idée que des politiques génériques de type VLA peuvent apprendre à grande échelle à partir de vidéos humaines, une direction que suivent aussi des modèles comme Pi-0 ou GR00T N2.
VisTacAlign reste un travail de recherche en preprint, sans produit ni déploiement industriel annoncé : la validation se limite à trois tâches en laboratoire. Il s'inscrit dans une vague de recherches cherchant à réduire la dépendance à la téléopération coûteuse via des démonstrations humaines, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Sa spécificité tient à la modalité tactile, moins explorée que le transfert purement visuel humain-robot. Le preprint n'annonce ni partenariat industriel ni calendrier de suite ; les prochaines étapes se limitent aux vidéos et documents disponibles sur la page du projet.
Dans nos dossiers




