Aller au contenu principal
ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines
RecherchearXiv cs.RO 

ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publiée le 24 août 2026 sur arXiv (2608.21355), l'étude ViTacPhys présente un système visuo-tactile qui estime la masse, la classe de frottement et la rigidité continue d'un objet à partir de démonstrations de manipulation humaines. Entraîné sur 60 objets rigides et déformables, le modèle combine modélisation temporelle visuo-tactile, fusion multimodale par cross-attention et a priori sémantique issu d'un modèle vision-langage. Sur des objets déjà vus, il atteint 97,2% de précision pour la masse, 98,8% pour le frottement et une erreur de 5,51% sur la rigidité; sur des objets inédits de catégories connues, ces scores tombent à 87,5%, 97,5% et 9,08%. Transféré vers un bras robotique via peu de données de téléopération, une augmentation vidéo au style robot et des démonstrations humaines aux gestes appariés, il pilote une préhension adaptative qui réussit 95,0% des prises sur objets connus et 83,4% hors distribution, avec des profils de force plus proches de la téléopération humaine que ceux de la référence ACT.

La plupart des modèles d'action vision-robot restent appris de bout en bout sans ancrage explicite sur les propriétés physiques de l'objet saisi, limitant l'adaptation de la force de préhension face à un objet glissant, lourd ou fragile. En conditionnant la prise sur masse, frottement et rigidité estimés, ViTacPhys produit des profils de force plus cohérents avec la téléopération humaine qu'une politique par imitation classique comme ACT, un signal utile pour la logistique, le tri de colis ou la manipulation d'objets déformables. Il reste toutefois un travail de recherche en prépublication, évalué en laboratoire sur 60 objets, sans déploiement industriel annoncé.

Le travail s'inscrit dans une tendance de la recherche en manipulation robotique visant à exploiter des démonstrations humaines équipées de capteurs tactiles pour amorcer l'apprentissage, en complément des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, plutôt calibrés sur la vision et la proprioception. ViTacPhys ne propose pas un nouveau VLA mais un module d'estimation physique conçu pour s'y greffer. L'abstract ne mentionne ni laboratoire ni entreprise partenaire ni calendrier de pilote: il s'agit d'une preuve de concept académique dont la suite logique serait une validation sur davantage d'objets et hors environnement contrôlé.

À lire aussi

TaRL : apprendre des récompenses générales et physiques à partir de démonstrations tactiles
1arXiv cs.RO 

TaRL : apprendre des récompenses générales et physiques à partir de démonstrations tactiles

Des chercheurs de l'équipe EmbodiedAI de la NTU (Nanyang Technological University) proposent TaRL (Tactile Reward Learning), un cadre qui apprend des fonctions de récompense à partir de démonstrations tactiles, pour l'apprentissage par renforcement (RL) de tâches de manipulation riches en contacts. Le système prend en entrée une séquence de cartes de déformation tactile et régresse un indice d'avancement de la tâche, en s'entraînant à la fois sur des démonstrations réussies et sur des échecs. Il a été évalué sur quatre tâches en simulation et deux en conditions réelles. Utilisé comme récompense de guidage (reward shaping), il améliore l'efficacité d'échantillonnage et le taux de succès final : sur l'enfilage d'écrou (nut threading), le succès passe de 34 % à 56 % en simulation, et sur le ramassage d'un cube, de 37 % à 97 % sur robot réel. Combiner récompenses tactiles et visuelles améliore encore les résultats. Un modèle entraîné sur le placement de boîtes a aussi été déployé directement sur le placement de canettes, avec un gain notable sur l'apprentissage de cette nouvelle tâche. L'intérêt tient à un verrou bien connu du RL : les récompenses éparses ralentissent l'apprentissage, et les récompenses denses sont difficiles à spécifier à la main. Les approches par récompense visuelle, apprises à partir de démonstrations sans actions, contournent le problème, mais elles ne voient que les objectifs visibles. Or beaucoup de tâches de manipulation dépendent de ce que la caméra ne capte pas : fermeté d'une prise, direction et intensité des forces appliquées. Le signal tactile décrit l'interaction locale entre robot et objet, ce qui le rend aussi robuste aux changements de disposition de la scène, comme la position de l'objet. Pour les intégrateurs, c'est une piste pour réduire l'ingénierie de récompenses sur des tâches d'assemblage ou d'insertion. Le saut de 37 % à 97 % est frappant, mais il porte sur une tâche simple, un seul cube, et ne dit rien de la tenue sur des pièces industrielles variées. Les résultats restent ceux d'un article préprint, sans validation indépendante ni test en cadence de production. Ce travail s'inscrit dans la montée des capteurs tactiles à base de déformation (type GelSight) et de l'apprentissage de récompenses à partir de vidéos, où la vision domine encore. Il complète les politiques vision-langage-action (VLA), majoritairement visuelles, qui peinent sur les tâches où la force compte. Le gain en généralisation d'un objet à l'autre reste à confirmer sur des catégories plus éloignées. Les prochaines étapes probables sont des tâches à plus fort contact, des capteurs différents et une intégration avec des modèles de fondation. Le code et la page projet sont annoncés, ce qui permettra à d'autres laboratoires de reproduire les chiffres.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Générer des mains robotiques à partir de démonstrations humaines
2arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source
VisTacAlign : co-entraînement de politiques dextériques sur des démonstrations tactiles humaines et robotiques
3arXiv cs.RO 

VisTacAlign : co-entraînement de politiques dextériques sur des démonstrations tactiles humaines et robotiques

Un preprint arXiv (2609.30959v1), publié fin septembre 2026 avec une page projet à vis-tac-align.github.io, présente VisTacAlign, un framework de co-entraînement de politiques de manipulation dextre combinant vision 3D et tactile. Des démonstrations humaines captées par un gant tracké sont retargetées vers une main robotique tactile à 17 degrés de liberté, avec une correction ponctuelle des doigts. La main humaine est effacée des vues stéréo et remplacée par un maillage de main robot texturé à partir d'images robot réelles, puis un modèle de fondation stéréo est réappliqué sur l'image composite pour homogénéiser les erreurs de perception entre les deux sources. Un gant tactile capacitif est calibré sur les capteurs de bout de doigt du robot, et un transformeur à diffusion ingère nuage de points, proprioception et tactile par doigt. Trois tâches réelles servent de test : assemblage de Lego, cueillette de fraises de tailles variables, activation et levage d'une perceuse. Résultat clé : combiner ces démonstrations humaines alignées avec des données robot existantes améliore les politiques par rapport à un entraînement robot seul, et les ablations montrent que tactile et alignement visuel sont chacun nécessaires. Pour les équipes de manipulation dextre, l'enjeu est économique : la téléopération robot reste lente et coûteuse à collecter, alors que les démonstrations humaines filmées à la main sont abondantes. Le verrou n'était pas le volume de données humaines mais l'écart d'incarnation entre main humaine et main robot. Ces travaux appuient l'idée que des politiques génériques de type VLA peuvent apprendre à grande échelle à partir de vidéos humaines, une direction que suivent aussi des modèles comme Pi-0 ou GR00T N2. VisTacAlign reste un travail de recherche en preprint, sans produit ni déploiement industriel annoncé : la validation se limite à trois tâches en laboratoire. Il s'inscrit dans une vague de recherches cherchant à réduire la dépendance à la téléopération coûteuse via des démonstrations humaines, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Sa spécificité tient à la modalité tactile, moins explorée que le transfert purement visuel humain-robot. Le preprint n'annonce ni partenariat industriel ni calendrier de suite ; les prochaines étapes se limitent aux vidéos et documents disponibles sur la page du projet.

RecherchePaper
1 source
Dex-X : manipulation dextérique visuo-tactile apprise à partir de vidéos humaines par interaction simulée
4arXiv cs.RO 

Dex-X : manipulation dextérique visuo-tactile apprise à partir de vidéos humaines par interaction simulée

Un article publié sur arXiv (arXiv:2609.07747v2) présente Dex-X, un framework qui entraîne des politiques de manipulation dextre visuo-tactile à partir de simples vidéos humaines monoculaires, sans collecte de données sur robot réel. Le système reconstruit en simulation les interactions main-objet filmées pour générer une supervision tactile physiquement cohérente, absente des vidéos d'origine, puis entraîne une politique "enseignante" distillée en une politique déployable utilisant nuages de points et capteurs tactiles. Sur une plateforme main-bras dextre, le transfert simulation-réel s'effectue en zero-shot sur des tâches de préhension et de manipulation d'outils à contact riche. La politique enseignante atteint 65,9% de réussite moyenne sur six catégories de tâches en simulation ; une fois distillée, elle affiche 93% de réussite en prise de cube réelle mais seulement 53% sur la tâche plus complexe de nettoyage de table, avec une généralisation zero-shot constatée sur des objets de géométries inédites. Le travail répond à une question clé pour le secteur : peut-on entraîner des politiques de manipulation dextre déployables à partir des vidéos humaines disponibles à l'échelle d'Internet, sans téléopération coûteuse pour collecter des données robot. Ces vidéos manquent justement du retour tactile indispensable aux tâches à contact riche, d'où l'idée de la simulation comme "moteur de complétion tactile", susceptible de réduire la dépendance des laboratoires aux campagnes de collecte coûteuses. L'écart entre 93% sur une tâche simple et 53% sur une tâche complexe rappelle toutefois que le sim-to-real reste loin d'être résolu à mesure que la manipulation se complexifie, une nuance qui vaut aussi pour les discours entourant les modèles visuo-langage-action génériques comme Pi-0 ou GR00T N2. La manipulation dextre multi-degrés-de-liberté reste un point dur de la robotique, plus exigeante en retour tactile que la préhension par pince industrielle classique, et les approches existantes reposent surtout sur la téléopération ou sur une simulation pure limitée par l'écart de réalisme physique avec le monde réel. Dex-X se positionne comme une voie intermédiaire, exploitant les vidéos humaines disponibles en masse plutôt que des démonstrations robot dédiées. L'article reste à ce stade une contribution académique publiée en version 2 sur arXiv, sans plateforme commerciale ni calendrier de déploiement annoncé, les auteurs indiquant vouloir étendre l'évaluation à davantage de tâches et de géométries d'objets.

RecherchePaper
1 source