Aller au contenu principal
DexDirect : guidage kinesthésique direct du bras pour une collecte efficace de démonstrations dextériques
RecherchearXiv cs.RO 

DexDirect : guidage kinesthésique direct du bras pour une collecte efficace de démonstrations dextériques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent DexDirect, une nouvelle interface de téléopération conçue pour accélérer la collecte de démonstrations de manipulation dextre, un goulot d'étranglement connu pour l'apprentissage robotique. Le système combine un guidage kinesthésique direct, l'opérateur tire littéralement un bras robotique à 6 degrés de liberté à compensation de gravité par une poignée, avec un simple webcam qui retranscrit les mouvements de l'autre main de l'opérateur sur une main robotique dextre à 16 articulations et 13 degrés de liberté. Selon les études utilisateurs menées par les auteurs, DexDirect permet de collecter 17,2 fois plus de démonstrations réussies que la référence purement visuelle AnyTeleop, et 3,2 fois plus que la référence par suivi de pose TeleDex. Un test NASA-TLX adapté montre une réduction nette de la charge mentale, de l'effort perçu et de la frustration des opérateurs, malgré une charge physique légèrement accrue liée à la manipulation directe du bras. Une politique de diffusion entraînée sur les démonstrations collectées via DexDirect atteint 90% de réussite sur une tâche de préhension-dépose de cube.

L'enjeu dépasse le simple confort d'utilisation. La collecte de données de manipulation dextre à grande échelle est aujourd'hui le principal frein au déploiement de politiques robustes de manipulation par apprentissage, notamment pour les architectures VLA (vision-language-action) qui nécessitent des volumes massifs de démonstrations de qualité. Les interfaces existantes forcent un compromis entre précision (matériel coûteux et lourd à installer) et accessibilité (solutions légères mais imprécises, épuisantes cognitivement pour l'opérateur). En réduisant drastiquement la charge mentale tout en démultipliant le taux de succès des démonstrations, DexDirect suggère qu'il est possible de lever ce compromis, un argument potentiellement décisif pour les laboratoires cherchant à industrialiser la collecte de données pour l'apprentissage par imitation.

Le travail est publié comme prépublication sur arXiv, sans identification d'un déploiement produit ou d'un partenariat industriel: il s'agit d'une contribution de recherche comparée à deux méthodes existantes de référence, AnyTeleop et TeleDex, plutôt que d'une annonce commerciale. Aucun acteur français ou européen n'est mentionné dans cette publication.

Dans nos dossiers

À lire aussi

EgoGuide : guidage égocentrique pour collecter des démonstrations sans robot et apprendre efficacement
1arXiv cs.RO 

EgoGuide : guidage égocentrique pour collecter des démonstrations sans robot et apprendre efficacement

Une équipe de chercheurs a publié en juin 2026 sur arXiv (2606.14665) EgoGuide, une interface de collecte de démonstrations robotiques sans robot physique. Le système enregistre simultanément deux flux vidéo : une caméra au poignet de l'opérateur (wrist view) et une caméra égocentrique portée sur la tête (egocentric view). Un module de guidage visuel-géométrique en ligne évalue la qualité de chaque épisode en temps réel et signale les données redondantes ou peu informatives avant leur accumulation dans le jeu d'entraînement. Les auteurs introduisent également une "Gated Egocentric Residual Policy", une architecture qui mobilise la vue égocentrique pour corriger les ambiguïtés de la vue poignet, tout en préservant la stabilité du contrôle moteur local. Les expériences en conditions réelles confirment une réduction du nombre d'épisodes de démonstration nécessaires et une meilleure robustesse face aux occultations visuelles. L'apport principal est de s'attaquer à un goulot d'étranglement bien identifié dans le domaine : le coût humain de la collecte de données de qualité. Les pipelines de type UMI (Universal Manipulation Interface), qui permettent à un opérateur de collecter des démonstrations manuellement sans robot dédié, produisent souvent des épisodes redondants et manquent de contexte global de scène. Le guidage en ligne réduit ce gaspillage dès la source. La politique résiduelle répond à un problème concret des systèmes d'imitation : la vue poignet seule est ambiguë lors d'occultations ou de passages critiques dans la trajectoire. Donner au modèle un accès conditionnel (gated) à la vue globale lève ces ambiguïtés sans déstabiliser le contrôle fin. Pour un intégrateur, cela signifie potentiellement moins d'heures de collecte humaine pour atteindre un niveau de performance équivalent. EgoGuide s'inscrit dans la lignée directe de l'UMI, développé par Cheng Chi et ses collaborateurs à Stanford et Columbia, qui a popularisé la collecte de démonstrations via des dispositifs portatifs instrumentés. Le verrou adressé ici n'est pas la quantité brute de données mais leur qualité et leur diversité informationnelle. Les approches concurrentes incluent ACT (Action Chunking Transformer), Diffusion Policy et les plateformes de téléopération à faible coût comme ALOHA. Ce travail reste une publication académique arXiv sans déploiement industriel annoncé, et les expériences présentées restent à l'échelle laboratoire. La combinaison guidage en ligne et politique bi-caméra présente toutefois un intérêt direct pour les équipes cherchant à réduire le coût opérationnel de la démonstration à grande échelle.

RechercheOpinion
1 source
SEED-UMI : exosquelette partagé entre humain et robot pour une démonstration dextérique en correspondance directe
2arXiv cs.RO 

SEED-UMI : exosquelette partagé entre humain et robot pour une démonstration dextérique en correspondance directe

Publié le 11 septembre 2026 sur arXiv (2609.11753), SEED-UMI est un framework d'apprentissage par imitation pour mains robotiques dextres qui fait porter le même exosquelette à l'humain et au robot. Les codeurs articulaires de l'exosquelette deviennent une mesure physique partagée, et des caméras fixées au poignet observent le même mécanisme pendant la collecte des démonstrations humaines et pendant l'exécution robotique. Le transfert de mouvement (retargeting) devient ainsi une supervision appariée entre les deux incarnations, ce qui permet d'entraîner les politiques directement sur les images brutes du poignet, sans segmentation ni inpainting. Sur cinq tâches riches en contacts, SEED-UMI collecte les données trois fois plus vite que la téléopération par exosquelette classique et atteint 70,0% de réussite moyenne en exécution. L'enjeu dépasse la prouesse technique : la collecte de démonstrations dextres reste le principal frein à l'entraînement à grande échelle des modèles vision-langage-action, alors que les mains robotiques accusent un retard net sur les progrès réalisés en locomotion bipède. Les exosquelettes actuels n'enregistrent que le côté humain et retargettent via des correspondances calibrées à vide, qui se dégradent dès qu'un contact physique intervient, un problème critique pour l'assemblage ou la préhension fine. En partageant le même exosquelette entre humain et robot, SEED-UMI supprime cette source de désalignement, ce qui pourrait réduire le coût des jeux de données pour les intégrateurs travaillant sur des mains robotiques commerciales. Un taux de réussite de 70% reste néanmoins loin de la fiabilité industrielle attendue en production, ce qui situe ce travail au stade de la recherche. Le nom du framework renvoie à UMI (Universal Manipulation Interface), une lignée de travaux ayant popularisé la capture de démonstrations par caméra portée à la main plutôt que par téléopération robotique directe. SEED-UMI s'inscrit dans un paysage où coexistent gants de motion capture et exosquelettes de téléopération, tandis que des modèles fondation comme Pi-0, GR00T N2 ou Helix cherchent à généraliser à partir de tels jeux de données pour piloter mains et humanoïdes variés. Publié comme simple preprint arXiv, sans institution ni calendrier de déploiement précisés, SEED-UMI reste une contribution méthodologique dont la reproductibilité et l'extension à d'autres mains robotiques restent à démontrer par la communauté.

RecherchePaper
1 source
Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines
3arXiv cs.RO 

Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines

Des chercheurs viennent de publier sur arXiv (arXiv:2607.08341, 10 juillet 2026) une nouvelle méthode baptisée AnyDexRT, conçue pour le retargeting cinématique des mains robotiques dextres en téléopération. Le retargeting consiste à traduire les mouvements de la main d'un opérateur humain en mouvements réalisables par une main robotique, une étape cruciale pour la téléopération et pour la collecte de démonstrations utilisées en apprentissage par imitation. Contrairement aux approches existantes, qui reposent souvent sur des objectifs conçus manuellement, un calibrage précis ou un appariement global des formes entre la main humaine et la main robotique, AnyDexRT ne nécessite aucune calibration préalable. La méthode combine un apprentissage auto-supervisé des correspondances entre le bout des doigts humains et robotiques avec un guidage humain en few-shot, c'est-à-dire à partir de très peu d'exemples, pour ancrer la correspondance dans les zones pertinentes pour la tâche. Un classificateur de contact affine ensuite spécifiquement les poses de préhension en pince. Cette approche répond à un problème concret et sous-estimé du secteur : la fragilité des pipelines de téléopération dès qu'on change de main robotique ou d'opérateur, ce qui limite la scalabilité de la collecte de données pour l'apprentissage par imitation, un goulot d'étranglement identifié dans le développement des modèles VLA (vision-langage-action) comme Pi-0 ou GR00T N2. En supprimant la calibration manuelle, AnyDexRT pourrait accélérer la production de démonstrations de qualité pour l'entraînement de politiques robotiques, un enjeu central pour les intégrateurs et laboratoires qui cherchent à faire passer leurs mains dextres de la démonstration en laboratoire à des déploiements plus robustes. Les auteurs rapportent des gains en qualité de retargeting et une réduction du réglage manuel sur des mains dextres variées et des tâches de téléopération réelles, sans toutefois préciser de métriques chiffrées vérifiables dans le résumé. Le travail s'inscrit dans la lignée des recherches sur le retargeting cross-embodiment, un axe actif face à la multiplication des mains robotiques commerciales aux morphologies différentes. Un site de projet accompagne la publication, mais aucun code, benchmark comparatif détaillé ni partenariat industriel n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit prêt à déployer.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines
4arXiv cs.RO 

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines

Wandercraft, Exotec, Pollen et Enchanted Tools ne sont pas mentionnés dans le papier, donc aucune mention forcée. Voici l'article : Une équipe de recherche publie CHORD (Contact Wrench Guidance from Human Demonstration in Robotic Dexterous Manipulation), un framework d'apprentissage par renforcement pour la manipulation dextre à long horizon d'objets rigides et articulés, dans un preprint arXiv daté du 2 juillet 2026 (arXiv:2607.00033v1). L'idée centrale consiste à représenter les mouvements humains et robotiques non pas par des trajectoires articulaires brutes, mais par les forces et couples (wrench) qu'ils induisent sur l'objet manipulé, ce qui permet de comparer directement leur effet plutôt que leur cinématique. Les chercheurs ont construit un benchmark de simulation de 4 739 tâches de manipulation bimanuelle dextre, issu de jeux de données de capture de mouvement et de vidéos reconstruites en interne. Sur 1 831 tâches évaluées, CHORD atteint un taux de réussite moyen de 82,12 %. La méthode se généralise aussi à la manipulation corps entier à partir de démonstrations limitées aux mains ou filmées à la troisième personne, avec 90,77 % de réussite, et les politiques apprises se transfèrent vers le réel en boucle ouverte comme en boucle fermée. L'enjeu dépasse la simple prouesse académique : l'apprentissage par renforcement pour la manipulation riche en contacts est réputé difficile à faire passer à l'échelle, car les démonstrations humaines se transposent mal aux mains robotiques dont la cinématique diffère. En ancrant le signal de guidage dans la physique des forces plutôt que dans les gestes eux-mêmes, CHORD contourne en partie ce fossé d'incarnation. Un benchmark de près de 5 000 tâches, avec transfert vérifié sur robot réel et non seulement en simulation, constitue un test de scalabilité plus rigoureux que la plupart des démonstrations ponctuelles habituelles du secteur. Ce travail s'inscrit dans une tendance plus large exploitant la capture de mouvement et la vidéo humaine pour entraîner des politiques robotiques, en parallèle des approches par imitation ou des modèles vision-langage-action comme Pi-0 ou GR00T N2. Étant un preprint, il reste à valider par relecture par les pairs, avec une portée réelle encore limitée aux conditions de laboratoire décrites.

RecherchePaper
1 source