Aller au contenu principal
RecherchearXiv cs.RO 

EgoWild2Dex apprend la manipulation robotique dextérique à partir d'expériences humaines réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

EgoWild2Dex, présenté le 22 septembre 2026 dans un article arXiv, apprend la manipulation dextre à des robots bimanuels à partir de vidéos humaines filmées à la première personne, non en studio mais dans des domiciles, des usines et des pharmacies, via des caméras portées sur la tête. Cette collecte en conditions réelles capture des gestes variés mais produit des vues instables, avec une rotation cumulée moyenne de 15,93 degrés par seconde due aux mouvements de tête. Pour corriger ce bruit, les auteurs introduisent GeoFormer, un transformeur géométrique différentiable qui recale les observations humaines sur le point de vue du robot, complété par un entraînement conjoint humain-robot réduisant l'écart d'incarnation entre main humaine et main robotique. Ils publient aussi EgoWild, 538,9 heures de vidéo, 179 049 épisodes, 125 961 descriptions de tâches et 1 282 catégories d'objets, sur lequel EgoWild2Dex atteint 96,7% de réussite sur trois tâches bimanuelles longues et 33,3% en zero-shot au niveau objet.

Ce travail s'inscrit dans une tendance de la robotique dextre visant à remplacer téléopération coûteuse et données simulées par de la vidéo humaine égocentrique collectée à grande échelle, une direction aussi suivie par des modèles comme GR00T N2 ou Helix, mais généralement en environnement contrôlé. En allant chercher ses démonstrations dans des usines et pharmacies réelles, l'équipe teste si l'apprentissage par imitation résiste au désordre du monde réel plutôt qu'à des trajectoires propres et répétables. L'écart entre le taux de réussite sur tâches entraînées (96,7%) et le taux zero-shot sur objets nouveaux (33,3%) confirme toutefois que la généralisation reste le principal verrou du secteur, bien avant l'exécution du geste lui-même.

Cette approche prolonge des travaux antérieurs de collecte par caméra portée, généralement menés en environnements aménagés pour limiter bruit visuel et occlusions, une contrainte qu'EgoWild2Dex cherche explicitement à lever. L'article ne nomme ni robot commercial ni partenaire industriel, seulement une plateforme bimanuelle à mains dextres, ce qui situe ce travail du côté recherche académique plutôt que produit, loin des démonstrations comme Figure 03 de Figure AI ou Optimus Gen 3 de Tesla. Les auteurs annoncent la publication à venir des données, modèles et code, sans date précise, ce qui permettra à la communauté d'évaluer la reproductibilité de résultats obtenus sur seulement trois tâches, et de mesurer si EgoWild sera repris pour entraîner d'autres modèles vision-langage-action.

À lire aussi

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien
1arXiv cs.RO 

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien

Des chercheurs ont mis en ligne sur arXiv en juin 2026 un algorithme nommé DO AS I DO, conçu pour extraire automatiquement des trajectoires de manipulation dextère à partir de vidéos RGB monoculaires filmant des mains humaines en action. Le pipeline reconstruit les interactions main-objet depuis des vidéos égocentriques (caméra portée par l'opérateur) ou exocentriques (caméra tierce), captées en conditions réelles et sans capteurs de profondeur ni marqueurs, puis effectue un retargeting de ces estimations vers des mains robotiques multi-doigts pour produire des séquences d'actions directement exécutables sur robot physique. Selon les évaluations conduites sur plusieurs jeux de données annotés ainsi que sur des clips collectés en ligne, DO AS I DO dépasse l'état de l'art précédent en précision d'estimation des interactions main-objet et en qualité des trajectoires extraites. L'enjeu est structurel : la collecte de données de manipulation reste le principal goulot d'étranglement pour entraîner des robots dextères. La téléopération est lente et coûteuse, la simulation difficile à transférer en conditions réelles sur des mains à 16 DOF ou plus, un phénomène connu sous le nom de sim-to-real gap. DO AS I DO propose une troisième voie en exploitant des vidéos déjà disponibles en ligne comme source de supervision passive, sans infrastructure dédiée. Pour les équipes R&D travaillant sur des manipulateurs multi-doigts, cela pourrait réduire significativement le coût de collecte de démonstrations. Les auteurs publient également un "efficacy playbook", soit un ensemble de recommandations pratiques destinées aux équipes terrain. Le point critique reste la fidélité du retargeting : le fossé cinématique entre les 21 degrés de liberté d'une main humaine et l'anatomie d'un effecteur robotique introduit des approximations que le papier reconnaît sans les quantifier de façon exhaustive. La manipulation dextère demeure l'un des problèmes les moins résolus de la robotique humanoïde commerciale. Physical Intelligence avec Pi-0, Figure AI avec Figure 03 et NVIDIA avec GR00T N2 investissent massivement dans des pipelines de données alternatifs, notamment la génération en simulation via DexMimicGen ou la téléopération structurée à grande échelle comme DROID et ALOHA 2. DO AS I DO se distingue en ciblant directement l'embodiment gap sans recourir à de l'infrastructure de capture spécialisée, en valorisant des vidéos grand public. Ce preprint ne mentionne aucun déploiement industriel ni partenariat commercial ; il s'agit d'une contribution académique, pas d'un produit prêt à l'emploi. L'étape naturelle sera de mesurer si ces trajectoires retargetées alimentent efficacement l'entraînement de modèles VLA à l'échelle, la question ouverte centrale de la robotique de manipulation en 2026.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines
2arXiv cs.RO 

Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines

Une équipe de chercheurs a publié sur arXiv (identifiant arXiv:2606.16436v1) un framework baptisé V2P-Manip, conçu pour extraire des politiques de manipulation dextre directement à partir de vidéos monoculaires de démonstrations humaines. L'architecture propose un pipeline intégré en trois étapes : acquisition d'assets 3D, estimation de trajectoires, puis apprentissage de politique de manipulation. Pour réconcilier perception visuelle et contraintes physiques, les auteurs introduisent un processus de raffinement en deux étapes imposant à la fois un alignement spatial et une cohérence physique. Le système a été évalué sur les benchmarks TACO et OakInk, deux jeux de données de référence en manipulation dextre, et affiche un taux de réussite moyen supérieur à 75 % sur des tâches de manipulation synthétiques, avec une généralisation démontrée sur plusieurs morphologies de mains robotiques différentes. L'enjeu central que V2P-Manip cherche à résoudre est celui du coût de collecte des données d'entraînement : la télé-opération reste lente, coûteuse et difficile à standardiser à grande échelle. Utiliser des vidéos monoculaires standard, sans capteurs de profondeur ni mocap, représente un levier de scalabilité potentiellement majeur pour les fabricants d'effecteurs dextres et les laboratoires à budget limité. Le pipeline démontre aussi une transférabilité des "manipulation priors" entre embodiments différents, ce qui est un résultat non trivial. Il faut néanmoins noter que le taux de 75 % est mesuré sur des tâches synthétiques et que les vidéos utilisées en entrée sont des démonstrations humaines sélectionnées -- le real-world gap reste à quantifier sur du matériel réel déployé en conditions industrielles non contrôlées. La manipulation dextre constitue l'une des frontières les plus dures de la robotique, un domaine où des acteurs comme Dexterous Robotics, Shadow Robot (UK) ou Psyonic tentent d'atteindre la maturité produit. Côté recherche, les approches concurrentes s'appuient généralement sur la télé-opération (Pi-0 de Physical Intelligence, ACT, DROID dataset) ou sur des capteurs de profondeur calibrés. L'originalité de V2P-Manip est de contourner ces contraintes matérielles en exploitant uniquement la vision monoculaire. La validation reste pour l'instant confinée à des benchmarks académiques, et aucun déploiement ou partenariat industriel n'est annoncé dans cette version préliminaire.

RecherchePaper
1 source
3PoinTr : apprentissage de la manipulation robotique à partir de vidéos humaines non contraintes
3arXiv cs.RO 

3PoinTr : apprentissage de la manipulation robotique à partir de vidéos humaines non contraintes

Une équipe de chercheurs a publié sur arXiv (2603.08485) une méthode baptisée 3PoinTr permettant d'entraîner des politiques de manipulation robotique à partir de vidéos humaines non contraintes, sans recourir à de coûteuses démonstrations téléopérées. Le principe repose sur la prédiction de trajectoires 3D denses de points de scène (point tracks) : un transformer léger dit "visibility-aware" apprend, depuis des vidéos d'humains en train de manipuler des objets librement, comment chaque point de la scène devrait se déplacer. Une politique robotique multitâche en boucle fermée extrait ensuite les priors d'action pertinents depuis ces trajectoires prédites. Avec seulement 20 démonstrations robot étiquetées en action, 3PoinTr surpasse les meilleures baselines de behavioral cloning et de vidéo-préentraînement de 25,0 points de pourcentage en tâches réelles et de 29,6 points en simulation. Ce résultat est notable parce qu'il s'attaque à l'un des goulots d'étranglement structurels du domaine : le coût prohibitif de la collecte de données robot. Les approches existantes de video-pretraining imposent typiquement que l'humain "joue le robot", mouvements chorégraphiés, keypoints prédéfinis, annotations manuelles ou positions de préhension connues. 3PoinTr supprime ces contraintes et exploite des vidéos naturalistes, ce qui élargit considérablement le corpus exploitable (YouTube, vidéos industrielles, données de formation existantes). La gestion des occlusions partielles via la supervision sur les points partiellement occultés représente une avancée technique précise par rapport aux baselines : le transformer conserve un signal d'apprentissage même quand la main ou l'outil masque une partie de la scène. Le travail s'inscrit dans une tendance plus large des Visual-Language-Action models (VLA) et des approches fondées sur les représentations 2D/3D pour le transfert sim-to-real, en compétition directe avec des méthodes comme Track2Act, RoboTAP ou ATM (Action Tracking from Motion). Il se distingue par le passage explicite à la 3D et le faible volume de données supervisées requis. La page projet est disponible chez Adam Hung (adamhung60.github.io/3PoinTr), mais aucune annonce de déploiement industriel ou de partenariat n'est associée à cette publication : il s'agit d'un résultat de recherche, pas d'un produit commercialisé.

RecherchePaper
1 source
UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines
4arXiv cs.RO 

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines

UniDex-ViTac, décrit dans un article arXiv de septembre 2026 (2609.16504), convertit des vidéos de démonstrations humaines en trajectoires robotiques simulées associées à des observations de contact au bout des doigts, via des spécialistes de renforcement résiduel qui adaptent, objet par objet, chaque interaction main-objet filmée à un bras-main robotique. À partir de 50 démonstrations humaines sur dix objets, les auteurs génèrent 10 000 trajectoires simulées pour entraîner une politique généraliste unique basée sur l'architecture Action Chunking with Transformers (ACT), combinant nuages de points, proprioception et quatre signaux de contact binaires par doigt, sans référence humaine ni pose d'objet connue au déploiement. En simulation, la version avec contact atteint 68,3% de réussite contre 55,5% pour une base vision seule ; sur robot réel, sans démonstration réelle ni réglage fin, elle réussit 73 essais sur 110 (66,4%) sur six objets vus et cinq inédits, contre 60 sur 110 (54,5%) pour la base de comparaison, un gain de 11,8 points. Le résultat vise un goulot d'étranglement connu de la manipulation dextre : le coût et la rareté des démonstrations robotiques réelles nécessaires à des politiques robustes. Qu'une politique entraînée uniquement en simulation, sans donnée robot réelle ni fine-tuning, réussisse plus de deux essais sur trois en conditions physiques alimente le débat sur la faisabilité du sim-to-real pour la manipulation fine avec retour tactile. L'ajout de simples signaux tactiles binaires, plutôt que des capteurs continus coûteux, améliore surtout la généralisation à des objets inédits, même si l'échantillon de 110 essais reste modeste pour en tirer des conclusions industrielles. Le travail s'inscrit dans une recherche plus large qui exploite les vidéos humaines non annotées pour contourner la téléopération, principal goulot d'étranglement de l'apprentissage par imitation en manipulation dextre. Sa contribution propre tient à la génération, par simulation physique, d'observations de contact absentes des vidéos humaines brutes, la comparaison avec une base vision seule isolant l'apport du signal tactile plutôt que celui de l'architecture ACT. L'article, accompagné d'une page projet (unidex-vitac.github.io), ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une preuve de faisabilité académique dont les suites attendues portent sur davantage d'objets, de tâches et une validation à plus grande échelle en conditions réelles.

RecherchePaper
1 source