Aller au contenu principal
Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique
RecherchearXiv cs.RO 

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent UVTA, un cadre qui exploite des démonstrations humaines enregistrées avec retour tactile pour améliorer les politiques de manipulation dextre des robots. L'équipe a d'abord construit un système de capture de mouvement tactile, qui enregistre de façon synchrone les images, les signaux tactiles et les mouvements de la main. Avec cet outil, elle a constitué le jeu de données UVTA, qui couvre cinq tâches riches en contacts. Il comprend 1 000 démonstrations humaines et 150 démonstrations robot par tâche. Le modèle associé, un Unified Visual-Tactile-Action Model, projette l'humain et le robot dans des représentations tactiles et d'action alignées. Il prédit conjointement les trajectoires futures d'action et de toucher. Les démonstrations humaines supervisent ainsi l'apprentissage de représentations sensibles au contact, et seules les actions du robot sont exécutées au déploiement. Lors d'évaluations sur robot réel, sur les cinq tâches, la méthode atteint 70 % de réussite moyenne. La meilleure base de comparaison visuo-tactile plafonne à 29 %, et une ablation d'architecture à 42 %.

L'enjeu tient au goulot d'étranglement des données tactiles. La téléopération de mains dextres ne renvoie à l'opérateur qu'un retour tactile limité, ce qui rend les démonstrations robot riches en toucher difficiles à collecter à grande échelle. Les auteurs contournent le problème avec l'hypothèse que la main change mais que la physique de l'interaction reste la même. Les données humaines deviennent alors une source de supervision plus abondante et plus variée. Les performances progressent avec le nombre de démonstrations humaines et ne saturent pas à 1 000 par tâche. Cela suggère qu'une montée en volume pourrait encore améliorer les résultats, sans que le papier le démontre au-delà. Pour les intégrateurs et les équipes qui développent des politiques de préhension fine, l'idée est de déplacer l'effort de collecte du robot vers l'humain, moins coûteux. Elle vise les tâches où la vision seule échoue, comme l'insertion, la manipulation en occlusion ou le contrôle de force.

Il s'agit d'un travail académique, pas d'un produit, et il faut lire les chiffres avec prudence. Le score de 70 % porte sur seulement cinq tâches, avec 150 démonstrations robot par tâche, dans un cadre de laboratoire. Le résumé ne précise ni la main utilisée, ni les capteurs tactiles, ni le nombre d'essais, ni la nature exacte des tâches. L'écart avec les bases de comparaison (29 % et 42 %) est net, mais il dépend de choix de baselines que seul le texte complet permet d'apprécier. Le papier s'inscrit dans un courant de recherche qui cherche à apprendre la manipulation à partir de vidéos et de gants de capture humains, pour dépasser la téléopération. Il ajoute ici la modalité tactile, encore peu présente dans les grands modèles vision-langage-action (VLA). La version 2 de l'article sur arXiv et une page projet (uni-vta.github.io) sont disponibles. Aucun déploiement industriel ni calendrier n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines
1arXiv cs.RO 

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines

UniDex-ViTac, décrit dans un article arXiv de septembre 2026 (2609.16504), convertit des vidéos de démonstrations humaines en trajectoires robotiques simulées associées à des observations de contact au bout des doigts, via des spécialistes de renforcement résiduel qui adaptent, objet par objet, chaque interaction main-objet filmée à un bras-main robotique. À partir de 50 démonstrations humaines sur dix objets, les auteurs génèrent 10 000 trajectoires simulées pour entraîner une politique généraliste unique basée sur l'architecture Action Chunking with Transformers (ACT), combinant nuages de points, proprioception et quatre signaux de contact binaires par doigt, sans référence humaine ni pose d'objet connue au déploiement. En simulation, la version avec contact atteint 68,3% de réussite contre 55,5% pour une base vision seule ; sur robot réel, sans démonstration réelle ni réglage fin, elle réussit 73 essais sur 110 (66,4%) sur six objets vus et cinq inédits, contre 60 sur 110 (54,5%) pour la base de comparaison, un gain de 11,8 points. Le résultat vise un goulot d'étranglement connu de la manipulation dextre : le coût et la rareté des démonstrations robotiques réelles nécessaires à des politiques robustes. Qu'une politique entraînée uniquement en simulation, sans donnée robot réelle ni fine-tuning, réussisse plus de deux essais sur trois en conditions physiques alimente le débat sur la faisabilité du sim-to-real pour la manipulation fine avec retour tactile. L'ajout de simples signaux tactiles binaires, plutôt que des capteurs continus coûteux, améliore surtout la généralisation à des objets inédits, même si l'échantillon de 110 essais reste modeste pour en tirer des conclusions industrielles. Le travail s'inscrit dans une recherche plus large qui exploite les vidéos humaines non annotées pour contourner la téléopération, principal goulot d'étranglement de l'apprentissage par imitation en manipulation dextre. Sa contribution propre tient à la génération, par simulation physique, d'observations de contact absentes des vidéos humaines brutes, la comparaison avec une base vision seule isolant l'apport du signal tactile plutôt que celui de l'architecture ACT. L'article, accompagné d'une page projet (unidex-vitac.github.io), ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une preuve de faisabilité académique dont les suites attendues portent sur davantage d'objets, de tâches et une validation à plus grande échelle en conditions réelles.

RecherchePaper
1 source
DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique
2arXiv cs.RO 

DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique

DexTouch-WM, publié en preprint sur arXiv (2609.20649v1), est un modèle du monde conditionné par l'action qui prédit conjointement les images RGB futures et la dynamique tactile bilatérale pour la manipulation dextre robotique. Il s'appuie sur des réseaux de capteurs piézorésistifs flexibles montés selon un schéma identique sur des mains humaines et robotiques, rendant leurs signaux tactiles directement comparables. Le mouvement humain est retranscrit dans l'espace d'action du robot, permettant à des démonstrations tactiles humaines de superviser le même modèle de dynamique que celui utilisé sur robot réel. L'architecture associe un vidéo expert pré-entraîné à un tactile expert léger via des tokens tenant compte de l'anatomie de la main. Les auteurs fixent cinq heures de données robot réel et font varier les données tactiles humaines de zéro à cent heures. Les tâches humaines et robotiques utilisées à l'entraînement étant disjointes, l'amélioration observée sur les prédictions visuelles, géométriques et de contact en domaine robot suggère un transfert réel des dynamiques de contact entre les deux embodiments. Cela vise le principal goulot d'étranglement de la manipulation dextre en contact riche: la collecte de données tactiles reste lente, coûteuse et liée à un capteur et un robot spécifiques. En montrant qu'une supervision tactile humaine, bien plus facile à collecter en volume, complète un budget de données robot limité, les auteurs proposent un axe de données alternatif à la téléopération ou à la simulation pure, utile pour entraîner des politiques de manipulation à plus grande échelle. Ce travail prolonge les modèles du monde vidéo déjà employés en robotique comme substituts de simulation, en y ajoutant une dynamique tactile bilatérale explicite, un axe encore peu exploité face à la vision et au langage dans la manipulation dextre. Il se positionne face aux approches misant uniquement sur la téléopération robot ou la simulation physique pour générer des données de contact. Publié comme preprint arXiv sans annonce de déploiement, de partenariat industriel ou de calendrier commercial, il reste une contribution de recherche: les auteurs présentent l'évaluation en environnement de substitution et la génération de trajectoires synthétiques pour l'apprentissage de politiques comme des pistes ouvertes plutôt que comme un système prêt à l'emploi.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines
3arXiv cs.RO 

Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines

Une équipe de chercheurs a publié sur arXiv (identifiant arXiv:2606.16436v1) un framework baptisé V2P-Manip, conçu pour extraire des politiques de manipulation dextre directement à partir de vidéos monoculaires de démonstrations humaines. L'architecture propose un pipeline intégré en trois étapes : acquisition d'assets 3D, estimation de trajectoires, puis apprentissage de politique de manipulation. Pour réconcilier perception visuelle et contraintes physiques, les auteurs introduisent un processus de raffinement en deux étapes imposant à la fois un alignement spatial et une cohérence physique. Le système a été évalué sur les benchmarks TACO et OakInk, deux jeux de données de référence en manipulation dextre, et affiche un taux de réussite moyen supérieur à 75 % sur des tâches de manipulation synthétiques, avec une généralisation démontrée sur plusieurs morphologies de mains robotiques différentes. L'enjeu central que V2P-Manip cherche à résoudre est celui du coût de collecte des données d'entraînement : la télé-opération reste lente, coûteuse et difficile à standardiser à grande échelle. Utiliser des vidéos monoculaires standard, sans capteurs de profondeur ni mocap, représente un levier de scalabilité potentiellement majeur pour les fabricants d'effecteurs dextres et les laboratoires à budget limité. Le pipeline démontre aussi une transférabilité des "manipulation priors" entre embodiments différents, ce qui est un résultat non trivial. Il faut néanmoins noter que le taux de 75 % est mesuré sur des tâches synthétiques et que les vidéos utilisées en entrée sont des démonstrations humaines sélectionnées -- le real-world gap reste à quantifier sur du matériel réel déployé en conditions industrielles non contrôlées. La manipulation dextre constitue l'une des frontières les plus dures de la robotique, un domaine où des acteurs comme Dexterous Robotics, Shadow Robot (UK) ou Psyonic tentent d'atteindre la maturité produit. Côté recherche, les approches concurrentes s'appuient généralement sur la télé-opération (Pi-0 de Physical Intelligence, ACT, DROID dataset) ou sur des capteurs de profondeur calibrés. L'originalité de V2P-Manip est de contourner ces contraintes matérielles en exploitant uniquement la vision monoculaire. La validation reste pour l'instant confinée à des benchmarks académiques, et aucun déploiement ou partenariat industriel n'est annoncé dans cette version préliminaire.

RecherchePaper
1 source
AdvDex : apprentissage de la manipulation dextérique à partir de démonstrations humaines par actions alignées sur les articulations et apprentissage adversarial
4arXiv cs.RO 

AdvDex : apprentissage de la manipulation dextérique à partir de démonstrations humaines par actions alignées sur les articulations et apprentissage adversarial

Une équipe de recherche présente AdvDex, un framework Vision-Language-Action (VLA) pour la manipulation dextre, dans un article publie sur arXiv (2608.14028v1). Le système combine trois éléments : OmniShare, un jeu de données multimodal de démonstrations de manipulation humaine offrant une supervision cinématique fine et des mesures tactiles sans recourir a une téléopération robotique couteuse ; le Joint-Aligned Action Space (JAAS), une représentation canonique de l'action associant une pose de poignet en SE(3) et 15 articulations des doigts, qui aligne fonctionnellement mains humaines, mains robotiques dextres et pinces parallèles ; et un apprentissage adversarial de domaine qui retire des représentations visuelles les indices spécifiques a chaque morphologie robotique. Les tests, portant sur la prédiction d'actions manuelles et sur des taches réelles de manipulation dextre, montrent des gains constants face aux méthodes de référence. Ce résultat répond a deux obstacles concrets du secteur : le cout de collecte des démonstrations robotiques et la faible portabilité d'une politique entre embodiments différents. AdvDex démontre un transfert zero-shot de l'humain vers le robot, une généralisation a des objets et environnements inédits, ainsi qu'une adaptation few-shot économe en données. Ce résultat appuie empiriquement une hypothèse centrale pour les modèles VLA comme Pi-0, GR00T N2 ou Helix : qu'une action canonique partagée peut réduire la dépendance a des flottes de téléopération dédiées par plateforme, un enjeu direct pour la vitesse de commercialisation des mains robotiques dextres. Le papier s'inscrit dans un courant de recherche visant a unifier les espaces d'action entre humains et robots pour exploiter les volumes de vidéo de manipulation humaine déjà disponibles, une direction également suivie par les équipes derrière Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). Classe comme nouvelle publication sur arXiv, AdvDex reste a ce stade une contribution académique évaluée sur des bancs d'essai internes, sans date de commercialisation, partenaire industriel ni déploiement annonce. La taille exacte du jeu OmniShare et les conditions précises des tests de généralisation ne sont pas détaillées, ce qui limite l'évaluation de la portée réelle de ces résultats hors du cadre expérimental du papier.

RechercheActu
1 source