
ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines
Publiée le 24 août 2026 sur arXiv (2608.21355), l'étude ViTacPhys présente un système visuo-tactile qui estime la masse, la classe de frottement et la rigidité continue d'un objet à partir de démonstrations de manipulation humaines. Entraîné sur 60 objets rigides et déformables, le modèle combine modélisation temporelle visuo-tactile, fusion multimodale par cross-attention et a priori sémantique issu d'un modèle vision-langage. Sur des objets déjà vus, il atteint 97,2% de précision pour la masse, 98,8% pour le frottement et une erreur de 5,51% sur la rigidité; sur des objets inédits de catégories connues, ces scores tombent à 87,5%, 97,5% et 9,08%. Transféré vers un bras robotique via peu de données de téléopération, une augmentation vidéo au style robot et des démonstrations humaines aux gestes appariés, il pilote une préhension adaptative qui réussit 95,0% des prises sur objets connus et 83,4% hors distribution, avec des profils de force plus proches de la téléopération humaine que ceux de la référence ACT.
La plupart des modèles d'action vision-robot restent appris de bout en bout sans ancrage explicite sur les propriétés physiques de l'objet saisi, limitant l'adaptation de la force de préhension face à un objet glissant, lourd ou fragile. En conditionnant la prise sur masse, frottement et rigidité estimés, ViTacPhys produit des profils de force plus cohérents avec la téléopération humaine qu'une politique par imitation classique comme ACT, un signal utile pour la logistique, le tri de colis ou la manipulation d'objets déformables. Il reste toutefois un travail de recherche en prépublication, évalué en laboratoire sur 60 objets, sans déploiement industriel annoncé.
Le travail s'inscrit dans une tendance de la recherche en manipulation robotique visant à exploiter des démonstrations humaines équipées de capteurs tactiles pour amorcer l'apprentissage, en complément des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, plutôt calibrés sur la vision et la proprioception. ViTacPhys ne propose pas un nouveau VLA mais un module d'estimation physique conçu pour s'y greffer. L'abstract ne mentionne ni laboratoire ni entreprise partenaire ni calendrier de pilote: il s'agit d'une preuve de concept académique dont la suite logique serait une validation sur davantage d'objets et hors environnement contrôlé.
Dans nos dossiers




