Aller au contenu principal
RecherchearXiv cs.RO 

DITTO-X : téléopération directe et inverse pour la manipulation dextère et l'intervention humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du Tele-operation and Manipulation Lab de Stanford (tml.stanford.edu) publient sur arXiv (2610.00781) DITTO-X, une interface de téléopération dextre qui restitue des forces articulaires et des événements de contact au bout des doigts. Ces informations proviennent de capteurs déjà présents sur la main robotique, sans ajout de matériel dédié. Le système pilote trois mains dextres commerciales, Sharpa, Wuji et Inspire, sans redesign propre à chacune, d'où son qualificatif de « hand-agnostic ». L'exosquelette est actionné, ce qui permet une téléopération inversée : avant le transfert de contrôle, le robot ramène les doigts de l'opérateur dans sa propre configuration. Selon les auteurs, DITTO-X améliore la qualité des démonstrations et le débit de collecte par rapport à un gant de suivi de main commercial, aussi bien pour la collecte de données que pour l'intervention humaine pendant le déploiement d'une politique, sur des tâches riches en contacts. Le résumé ne donne ni chiffres ni nombre de tâches, et le gant comparé n'y est pas nommé.

Ce travail s'attaque à un point faible de la chaîne de données de la manipulation robotique. Les démonstrations téléopérées alimentent l'apprentissage par imitation et les modèles vision-langage-action (VLA). Les interventions humaines servent à corriger les politiques une fois déployées. Or la plupart des systèmes ferment la boucle par la seule vision et sont pensés pour des pinces parallèles. L'opérateur ne ressent donc pas le contact et voit la scène à travers des caméras souvent occultées par la main elle-même. Le cas le plus pénalisant est l'autonomie partagée : l'opérateur doit reprendre la main en plein geste, avec un objet déjà saisi. La téléopération inversée vise ce moment de transition, où un décalage entre l'état de la main humaine et celui de la main robotique peut lâcher ou écraser l'objet. Si les gains se confirment à l'échelle, des données de meilleure qualité, avec retour d'effort, bénéficieraient directement aux mains à haut nombre de degrés de liberté, aujourd'hui limitées par la pauvreté des jeux de données dextres.

Le projet prolonge l'essor des mains dextres commerciales, notamment chinoises, qui font baisser le coût d'accès à la manipulation fine. Il s'inscrit aussi dans la course à la collecte de données pour les VLA, face aux gants de suivi et aux dispositifs de capture sans robot. Il s'agit d'un preprint v1, non relu par les pairs, avec des résultats annoncés par les auteurs et sans déploiement industriel. Les points à vérifier sont l'ampleur réelle des gains, la diversité des tâches, le coût et l'encombrement de l'exosquelette actionné, et sa tenue en usage prolongé. Une publication du code ou des plans en faciliterait la reproduction.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

DITTO : une interface dextérique pour la téléopération transparente
1arXiv cs.RO 

DITTO : une interface dextérique pour la téléopération transparente

Un nouveau papier publié sur arXiv (identifiant 2609.19196) présente DITTO, pour Dexterous Interface for Transparent TeleOperation, une interface matérielle destinée à la collecte de données de manipulation dextre. Le système combine une main robotique à 7 degrés de liberté (DOF) et un exosquelette motorisé conçu pour être cinématiquement équivalent à cette main, selon un co-design anatomiquement informé. Un mappage direct, actionneur par actionneur, relie l'exosquelette à la main robotique, ce qui permet d'utiliser la même plateforme pour deux usages : la collecte de données en conditions naturelles et portables, dite « in-the-wild », et la téléopération bilatérale avec retour de force au niveau de chaque articulation. Les auteurs précisent que l'exosquelette couvre l'espace de travail naturel de l'opérateur entre l'index et le pouce. Les capacités du système sont démontrées via des politiques de manipulation apprises sur des tâches impliquant des contacts complexes, sans que le papier ne fournisse de chiffres de temps de cycle, de volumes de déploiement ou de prix. Pour l'industrie de la manipulation robotique, l'enjeu ciblé est central : la qualité des données d'entraînement conditionne directement la performance des politiques de manipulation, y compris les architectures VLA de plus en plus utilisées pour piloter des mains dextres. Jusqu'ici, les équipes devaient arbitrer entre deux approches imparfaites. La téléopération classique produit des données cohérentes avec le robot cible mais prive l'opérateur de sensation de contact, ce qui dégrade la finesse des gestes capturés sur des tâches délicates. Les systèmes portables restituent au contraire naturellement les forces perçues par la main humaine, mais introduisent un écart d'incarnation visuelle au moment du déploiement, le robot ne percevant pas la scène comme l'outil ayant servi à la collecte. En unifiant les deux modes sur une seule plateforme plutôt que sur deux matériels distincts, DITTO cherche à réduire ce compromis structurel, un point que suivront les équipes qui constituent des jeux de données de manipulation dextre pour entraîner leurs modèles. Le sujet s'inscrit dans une difficulté connue de la recherche en manipulation : les mains à haut nombre de degrés de liberté exigent des interfaces capables de restituer à la fois la richesse du mouvement et les interactions de contact nécessaires à une manipulation précise, deux exigences que les gants de données et la téléopération classique satisfont rarement ensemble. D'autres travaux sur la capture portable avaient déjà tenté de contourner ce problème sans résoudre l'écart d'incarnation au déploiement. Publié comme un nouveau papier de recherche, DITTO reste à ce stade une démonstration académique de faisabilité, validée sur des tâches de manipulation riches en contact, et non un produit commercialisé ni un déploiement industriel ; le texte ne mentionne aucun partenariat ni calendrier de mise sur le marché.

RecherchePaper
1 source
Un cadre de téléopération bilatérale pour la manipulation dextérique
2arXiv cs.RO 

Un cadre de téléopération bilatérale pour la manipulation dextérique

Une équipe de chercheurs publie, dans un preprint arXiv déposé en juin 2026 (arXiv:2606.15434), un système modulaire de téleopération bilatérale conçu pour la manipulation dextre en environnements réels à fort contact. L'architecture proposée couple une interface côté opérateur à un bras robotique compliant et à une main mécanique dextre côté robot, dans une boucle de contrôle unifiée. Quatre fonctionnalités centrales sont documentées : le retargeting de posture de main par positions (adaptation des commandes d'une main humaine vers une main robotique de morphologie différente), la commande différentielle du bras, le retour haptique multi-échelle, et un mécanisme de contrôle partagé pour stabiliser les phases de manipulation en contact. Le framework est validé sur une tâche réelle de manipulation dextre, sans que les métriques de performance - latence, temps de cycle, taux de succès - ne soient communiquées dans le résumé public disponible. L'intérêt principal de ce travail pour les équipes de recherche et les intégrateurs ne réside pas dans les performances brutes du système de téleopération lui-même, mais dans sa vocation déclarée de plateforme de collecte de démonstrations haute qualité pour l'apprentissage par imitation (learning from demonstration). À l'heure où les architectures VLA (Vision-Language-Action) - comme pi0 de Physical Intelligence ou GR00T N2 de NVIDIA - exigent des datasets massifs de trajectoires expertes en manipulation fine, la qualité du pipeline de collecte devient un goulot d'étranglement critique. Les auteurs identifient aussi trois problèmes de conception restant ouverts : le mismatch cross-embodiment (écart morphologique entre la main de l'opérateur et celle du robot), la granularité du retour haptique, et le dosage optimal du contrôle partagé. Ce framework s'inscrit dans une tendance de fond visant à standardiser l'infrastructure de collecte de données téléopérées, dans la lignée du système ALOHA de Stanford ou de la plateforme UMI. Les acteurs européens comme Enchanted Tools (France) ou les équipes robotique de l'INRIA travaillent sur des problématiques similaires de couplage haptique et de retargeting pour la manipulation fine. Ce preprint ne présente pas de chiffres de déploiement ni de partenariats industriels annoncés : il s'agit d'une contribution académique amont, dont la suite logique serait la publication d'un dataset de démonstrations et de benchmarks comparatifs sur des tâches de manipulation standardisées.

UELes équipes françaises (Enchanted Tools, INRIA) travaillent sur des problématiques similaires de couplage haptique et de retargeting, ce framework pourrait alimenter leurs pipelines de collecte de démonstrations pour entraîner des modèles VLA.

RecherchePaper
1 source
AHEAD : téléopération prédictive de la main par anticipation de l'intention humaine
3arXiv cs.RO 

AHEAD : téléopération prédictive de la main par anticipation de l'intention humaine

Cette semaine, un article publié sur arXiv (2607.15172v1) présente AHEAD, un système de téléopération en réalité virtuelle capable d'anticiper les intentions de l'opérateur pour accélérer le contrôle d'un robot manipulateur. Dans la téléopération directe classique, chaque mouvement de la main est retranscrit image par image sur l'effecteur du robot, ce qui offre une précision fine mais impose une surveillance constante et fatigante lors de l'approche, de la saisie et du dépôt d'objets. La téléopération supervisée par objectifs, où l'opérateur fixe des points de passage que le robot atteint via un planificateur, réduit la charge cognitive mais introduit une latence d'attente entre chaque commande. AHEAD combine les deux approches dans un jumeau numérique: l'opérateur effectue des gestes naturels de préhension et de placement, et un classifieur basé sur l'attention analyse une courte fenêtre de signaux 3D de la main et de la tête, associée au contexte de la scène, pour prédire l'objet visé et l'emplacement de dépôt. Une machine à états transforme ensuite ces prédictions en objectifs stables pour le robot, permettant un déclenchement anticipé du mouvement tout en restant robuste face aux prédictions bruitées ou aux corrections gestuelles. Le module de prédiction atteint une précision Top-1 de 76% pour l'identification de l'objet à saisir et 76% pour le créneau de placement cible. Cette approche s'attaque directement à un compromis structurel de la téléopération industrielle: la précision du contrôle direct contre la fluidité du contrôle par objectifs. Pour les intégrateurs travaillant sur des tâches répétitives de pick-and-place télé-opérées, en logistique ou en assemblage, une réduction mesurable de la latence de réaction combinée à une charge opérateur allégée pourrait justifier l'adoption de systèmes hybrides plutôt que le choix binaire actuel entre contrôle manuel intensif et planification automatisée plus lente. L'étude utilisateur associée montre des gains concrets: la latence de réaction du robot diminue de 0,6 seconde pour la reconnaissance d'objet et de 1,4 seconde pour le créneau de placement par rapport aux méthodes de référence, avec une charge de travail perçue par les participants en baisse. Ces résultats s'inscrivent dans un courant de recherche plus large sur la prédiction d'intention humaine en téléopération VR, où l'enjeu est de rapprocher la réactivité de systèmes semi-autonomes de celle du contrôle manuel direct, sans reproduire sa charge cognitive. Le papier ne précise pas de plateforme robotique commerciale ni de partenaire industriel; il s'agit à ce stade d'une contribution méthodologique évaluée en environnement contrôlé, dont la transposition à des cas d'usage industriels réels reste à démontrer.

RecherchePaper
1 source
DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
4arXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5. Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables. DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

RecherchePaper
1 source