Aller au contenu principal
RecherchearXiv cs.RO 

YOCO : Un seul étalonnage suffit ! Calibration rapide de la capture de mouvement pour la téléopération dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.11657) YOCO, pour « You Only Calibrate Once », un cadre de calibration de capture de mouvement destiné à la téléopération dextre. Il corrige les flux de poses de main biaisés produits par les gants de capture bon marché et les trackers sans marqueurs. Le système part d'un petit nombre de paires de poses, brutes et cibles, et n'exige aucun fine-tuning. Un HyperNet de calibration est conditionné sur ces exemples et prédit des mises à jour de type LoRA pour un module d'estimation de main MANO gelé. La calibration par opérateur ou par session devient donc une étape d'adaptation feed-forward légère, au lieu d'un entraînement séparé pour chaque utilisateur. Le modèle est entraîné avec des dérives synthétiques ajoutées à InterHand2.6M. Il est évalué sur des séquences InterHand augmentées, sur des données réelles de gants hors ligne et sur des tâches de téléopération dextre. Les auteurs annoncent de meilleurs résultats en efficacité de calibration, en qualité d'estimation de l'état de la main et en performance de téléopération, face à l'entrée non calibrée et à des méthodes de calibration standard. Le résumé ne donne aucun chiffre.

Le problème visé est concret pour quiconque collecte des démonstrations pour des mains robotiques multidoigts. Les gants à bas coût dérivent selon la morphologie de l'utilisateur, l'ajustement du gant et la session d'enregistrement. Ce biais se retrouve dans le retargeting vers la main robot, puis dans les données d'apprentissage par imitation, ce qui dégrade la qualité des démonstrations à la source. Une calibration rapide et peu coûteuse en échantillons réduirait le temps d'immobilisation des opérateurs, un point sensible quand une flotte de téléopérateurs alimente des modèles VLA. Conserver le prior géométrique de MANO tout en gardant un estimateur compact est aussi un choix pertinent pour la latence en temps réel. Il faut toutefois rester prudent : l'entraînement repose sur des dérives synthétiques, et rien dans le résumé ne dit que celles-ci couvrent la variété des erreurs de gants réels. Les résultats en téléopération n'ont par ailleurs pas encore été quantifiés publiquement, et le préprint n'a pas été évalué par des pairs.

Ce travail s'inscrit dans la course à la donnée de manipulation dextre, où gants, exosquelettes et suivi par caméra servent à nourrir des politiques apprises. Les approches existantes calibrent le plus souvent par optimisation par utilisateur ou par recalage manuel, longs et peu adaptés au passage à l'échelle. L'usage de hyper-réseaux pour générer des adaptateurs LoRA transpose à la perception de la main une idée déjà répandue dans les grands modèles. Les prochaines étapes à surveiller sont la publication du code et des poids, la validation sur plusieurs marques de gants et sur des mains robotiques variées, et la mesure de l'effet sur le taux de réussite de politiques entraînées avec ces démonstrations corrigées.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Un cadre de téléopération bilatérale pour la manipulation dextérique
1arXiv cs.RO 

Un cadre de téléopération bilatérale pour la manipulation dextérique

Une équipe de chercheurs publie, dans un preprint arXiv déposé en juin 2026 (arXiv:2606.15434), un système modulaire de téleopération bilatérale conçu pour la manipulation dextre en environnements réels à fort contact. L'architecture proposée couple une interface côté opérateur à un bras robotique compliant et à une main mécanique dextre côté robot, dans une boucle de contrôle unifiée. Quatre fonctionnalités centrales sont documentées : le retargeting de posture de main par positions (adaptation des commandes d'une main humaine vers une main robotique de morphologie différente), la commande différentielle du bras, le retour haptique multi-échelle, et un mécanisme de contrôle partagé pour stabiliser les phases de manipulation en contact. Le framework est validé sur une tâche réelle de manipulation dextre, sans que les métriques de performance - latence, temps de cycle, taux de succès - ne soient communiquées dans le résumé public disponible. L'intérêt principal de ce travail pour les équipes de recherche et les intégrateurs ne réside pas dans les performances brutes du système de téleopération lui-même, mais dans sa vocation déclarée de plateforme de collecte de démonstrations haute qualité pour l'apprentissage par imitation (learning from demonstration). À l'heure où les architectures VLA (Vision-Language-Action) - comme pi0 de Physical Intelligence ou GR00T N2 de NVIDIA - exigent des datasets massifs de trajectoires expertes en manipulation fine, la qualité du pipeline de collecte devient un goulot d'étranglement critique. Les auteurs identifient aussi trois problèmes de conception restant ouverts : le mismatch cross-embodiment (écart morphologique entre la main de l'opérateur et celle du robot), la granularité du retour haptique, et le dosage optimal du contrôle partagé. Ce framework s'inscrit dans une tendance de fond visant à standardiser l'infrastructure de collecte de données téléopérées, dans la lignée du système ALOHA de Stanford ou de la plateforme UMI. Les acteurs européens comme Enchanted Tools (France) ou les équipes robotique de l'INRIA travaillent sur des problématiques similaires de couplage haptique et de retargeting pour la manipulation fine. Ce preprint ne présente pas de chiffres de déploiement ni de partenariats industriels annoncés : il s'agit d'une contribution académique amont, dont la suite logique serait la publication d'un dataset de démonstrations et de benchmarks comparatifs sur des tâches de manipulation standardisées.

UELes équipes françaises (Enchanted Tools, INRIA) travaillent sur des problématiques similaires de couplage haptique et de retargeting, ce framework pourrait alimenter leurs pipelines de collecte de démonstrations pour entraîner des modèles VLA.

RecherchePaper
1 source
Gant à Fibre Optique pour la Capture de Mouvements de Manipulation Dextérique Haute Performance
2arXiv cs.RO 

Gant à Fibre Optique pour la Capture de Mouvements de Manipulation Dextérique Haute Performance

Des chercheurs ont publié sur arXiv (2608.24572) un gant à fibres optiques pour capturer la pose complète de la main pendant des manipulations fines. Des fibres multi-cœurs y mesurent la forme 3D entière de chaque fibre, et non sa seule courbure comme les capteurs flexibles classiques. Un pipeline recale ces formes dans un repère commun de la main, puis un solveur cinématique inverse reconstruit la pose à 60 Hz. Testé sur deux heures de manipulation d'objets avec cinq sujets, le gant obtient 7,2 mm d'erreur moyenne au bout des doigts face à une référence de motion capture, ramenée à 4,9 mm par une calibration usine du hub de fibres, transférable entre utilisateurs et sessions. Cette précision, proche des systèmes de motion capture professionnels, vise un goulot d'étranglement connu: la vision échoue dès que la main occlut l'objet manipulé ou sous éclairage difficile. Les gants instrumentés existants dérivent ou souffrent d'interférences magnétiques sans jamais égaler cette précision. Pour les équipes qui collectent des démonstrations humaines destinées aux modèles vision-langage-action, la qualité de la trajectoire de main captée conditionne celle des politiques apprises. Un gant occlusion-free au millimètre près promet une collecte plus scalable que les rigs optiques, qui exigent un environnement contrôlé à plusieurs caméras, et intéresse aussi les intégrateurs pratiquant la téléopération virtuelle bimanuelle. La détection de forme par fibre optique multi-cœur est déjà utilisée en robotique chirurgicale et pour le suivi de cathéters. Son application à la pose de main entière est présentée comme nouvelle. Le travail reste une contribution de recherche en preprint, sans entreprise ni produit commercial associé, et sans démonstration sur un robot physique complet. Il s'inscrit dans une dynamique plus large où la collecte de démonstrations de haute fidélité, via gants, exosquelettes ou contrôleurs VR, conditionne l'entraînement des modèles VLA qui équipent des mains robotiques sur des plateformes comme Figure 03, Optimus Gen 3 ou GR00T N2, sans calendrier ni partenariat annoncé.

RecherchePaper
1 source
DITTO : une interface dextérique pour la téléopération transparente
3arXiv cs.RO 

DITTO : une interface dextérique pour la téléopération transparente

Un nouveau papier publié sur arXiv (identifiant 2609.19196) présente DITTO, pour Dexterous Interface for Transparent TeleOperation, une interface matérielle destinée à la collecte de données de manipulation dextre. Le système combine une main robotique à 7 degrés de liberté (DOF) et un exosquelette motorisé conçu pour être cinématiquement équivalent à cette main, selon un co-design anatomiquement informé. Un mappage direct, actionneur par actionneur, relie l'exosquelette à la main robotique, ce qui permet d'utiliser la même plateforme pour deux usages : la collecte de données en conditions naturelles et portables, dite « in-the-wild », et la téléopération bilatérale avec retour de force au niveau de chaque articulation. Les auteurs précisent que l'exosquelette couvre l'espace de travail naturel de l'opérateur entre l'index et le pouce. Les capacités du système sont démontrées via des politiques de manipulation apprises sur des tâches impliquant des contacts complexes, sans que le papier ne fournisse de chiffres de temps de cycle, de volumes de déploiement ou de prix. Pour l'industrie de la manipulation robotique, l'enjeu ciblé est central : la qualité des données d'entraînement conditionne directement la performance des politiques de manipulation, y compris les architectures VLA de plus en plus utilisées pour piloter des mains dextres. Jusqu'ici, les équipes devaient arbitrer entre deux approches imparfaites. La téléopération classique produit des données cohérentes avec le robot cible mais prive l'opérateur de sensation de contact, ce qui dégrade la finesse des gestes capturés sur des tâches délicates. Les systèmes portables restituent au contraire naturellement les forces perçues par la main humaine, mais introduisent un écart d'incarnation visuelle au moment du déploiement, le robot ne percevant pas la scène comme l'outil ayant servi à la collecte. En unifiant les deux modes sur une seule plateforme plutôt que sur deux matériels distincts, DITTO cherche à réduire ce compromis structurel, un point que suivront les équipes qui constituent des jeux de données de manipulation dextre pour entraîner leurs modèles. Le sujet s'inscrit dans une difficulté connue de la recherche en manipulation : les mains à haut nombre de degrés de liberté exigent des interfaces capables de restituer à la fois la richesse du mouvement et les interactions de contact nécessaires à une manipulation précise, deux exigences que les gants de données et la téléopération classique satisfont rarement ensemble. D'autres travaux sur la capture portable avaient déjà tenté de contourner ce problème sans résoudre l'écart d'incarnation au déploiement. Publié comme un nouveau papier de recherche, DITTO reste à ce stade une démonstration académique de faisabilité, validée sur des tâches de manipulation riches en contact, et non un produit commercialisé ni un déploiement industriel ; le texte ne mentionne aucun partenariat ni calendrier de mise sur le marché.

RecherchePaper
1 source
DexTele : un système de téléopération dextre à double bras basé sur le reciblage de mouvement et le contrôle de force adaptatif
4arXiv cs.RO 

DexTele : un système de téléopération dextre à double bras basé sur le reciblage de mouvement et le contrôle de force adaptatif

Des chercheurs viennent de publier sur arXiv (arXiv:2607.05883v1) une nouvelle architecture de télé-opération bimanuelle baptisée DexTele, conçue pour reproduire des gestes humains dextres sur des bras robotiques hétérogènes. Le système repose sur deux briques. La première est un module de retargeting de mouvement basé sur la vision, qui transforme des images humaines en trajectoires robotiques préliminaires grâce à un encodeur de graphe de mouvement et une optimisation dans l'espace latent, pensé pour fonctionner sur plusieurs plateformes robotiques sans reconception spécifique. La seconde est un module de préhension adaptative qui combine un modèle vision-langage (VLM) avec du contrôle prédictif (MPC) : le VLM estime la force de serrage nécessaire pour un objet cible, puis une optimisation en ligne par gradient ajuste cette force en temps réel. Les auteurs rapportent des expériences étendues montrant un retargeting précis et une préhension compliante généralisables à plusieurs plateformes robotiques, sans toutefois publier de chiffres de taux de réussite ou de comparaisons avec des systèmes existants dans le résumé. L'enjeu pour l'industrie est double. D'abord, l'hétérogénéité des bras et mains robotiques (nombre de degrés de liberté, cinématique, actionneurs) reste un frein majeur à la réutilisation de données de télé-opération d'une plateforme à l'autre, un problème critique pour les équipes qui collectent des démonstrations humaines afin d'entraîner des modèles vision-langage-action. Ensuite, la préhension compliante par force adaptative, plutôt que par simple asservissement en position, s'attaque directement au problème du sim-to-real et de la manipulation d'objets de forme ou de rigidité variable, un point où beaucoup de démonstrations actuelles échouent en conditions réelles. DexTele s'inscrit dans une vague de systèmes de télé-opération (type ALOHA, Mobile ALOHA, GELLO, Open-TeleVision) développés ces deux dernières années pour alimenter en données des modèles comme GR00T, Pi-0 ou Helix. Ce papier, encore au stade de prépublication sans code ni plateforme matérielle précisée, devra être confirmé par une validation indépendante et des comparaisons chiffrées face à ces solutions existantes avant toute adoption industrielle.

RecherchePaper
1 source