Aller au contenu principal
RecherchearXiv cs.RO 

OmniHOI : interaction main-objet dextérique à partir d'une vidéo humaine monoculaire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

OmniHOI, un pipeline présenté sur arXiv (2610.10855), transforme une simple vidéo RGB monoculaire d'interaction main-objet en trajectoire exécutable par des mains robotiques dextres. Il enchaîne trois étapes, chacune contrainte par la preuve disponible à son niveau: l'image pendant la reconstruction, la géométrie de contact pendant le retargeting, puis la dynamique lors d'un raffinement avec simulation physique dans la boucle. Les auteurs testent d'abord 150 trajectoires de motion capture transférées vers cinq mains dextres de 6 à 22 DoF, avec 39 à 89 % de succès contre 31 % au mieux pour les méthodes de transfert antérieures. Sur 60 clips vidéo monoculaires, le taux de réussite atteint 53 %, contre 28 % pour le meilleur pipeline vidéo-vers-robot existant. Les trajectoires produites sont aussi exécutées sur un robot bimanuel réel, sur plusieurs tâches.

L'enjeu est l'accès aux données. Les vidéos de manipulation humaine abondent, mais les exploiter pour entraîner ou piloter des mains robotiques butte sur deux écueils: les approches reposant sur l'apprentissage par renforcement propre à chaque tâche passent mal à l'échelle, tandis que celles qui supposent des trajectoires de motion capture propres ne fonctionnent pas sur de la vidéo ordinaire. En corrigeant les erreurs à chaque étape plutôt que de les laisser se propager jusqu'à une politique apprise, OmniHOI vise à rendre la vidéo humaine directement exploitable comme source de démonstrations dextres. Les chiffres appellent toutefois à la prudence. Un succès de 53 % sur 60 clips reste modeste pour un usage industriel, la fourchette de 39 à 89 % selon la main montre une forte dépendance à la morphologie, et l'article ne précise ni la diversité des tâches ni la nature de la validation sur robot réel, qui semble qualitative. Il s'agit d'un résultat de recherche, sans produit ni déploiement.

Ce travail s'inscrit dans la course à la donnée pour la manipulation dextre. Plusieurs acteurs misent sur la téléopération, les gants ou les exosquelettes, qui donnent des données propres mais coûteuses. D'autres cherchent à exploiter les vidéos humaines à grande échelle, ce qui suppose de résoudre l'écart de morphologie entre la main humaine et des mains robotiques très variées. OmniHOI se positionne comme une couche intermédiaire indépendante de la main cible, face à des méthodes soit spécialisées par tâche, soit limitées aux données de capture de mouvement. La suite logique serait de tester ces trajectoires comme données d'entraînement pour des politiques de type VLA, et de mesurer le taux de succès sur des tâches plus longues et plus variées. Le papier est une prépublication v1, non évaluée par des pairs, et aucun calendrier de code ou de déploiement n'est mentionné.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines
1arXiv cs.RO 

Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines

Une équipe de chercheurs a publié sur arXiv (identifiant arXiv:2606.16436v1) un framework baptisé V2P-Manip, conçu pour extraire des politiques de manipulation dextre directement à partir de vidéos monoculaires de démonstrations humaines. L'architecture propose un pipeline intégré en trois étapes : acquisition d'assets 3D, estimation de trajectoires, puis apprentissage de politique de manipulation. Pour réconcilier perception visuelle et contraintes physiques, les auteurs introduisent un processus de raffinement en deux étapes imposant à la fois un alignement spatial et une cohérence physique. Le système a été évalué sur les benchmarks TACO et OakInk, deux jeux de données de référence en manipulation dextre, et affiche un taux de réussite moyen supérieur à 75 % sur des tâches de manipulation synthétiques, avec une généralisation démontrée sur plusieurs morphologies de mains robotiques différentes. L'enjeu central que V2P-Manip cherche à résoudre est celui du coût de collecte des données d'entraînement : la télé-opération reste lente, coûteuse et difficile à standardiser à grande échelle. Utiliser des vidéos monoculaires standard, sans capteurs de profondeur ni mocap, représente un levier de scalabilité potentiellement majeur pour les fabricants d'effecteurs dextres et les laboratoires à budget limité. Le pipeline démontre aussi une transférabilité des "manipulation priors" entre embodiments différents, ce qui est un résultat non trivial. Il faut néanmoins noter que le taux de 75 % est mesuré sur des tâches synthétiques et que les vidéos utilisées en entrée sont des démonstrations humaines sélectionnées -- le real-world gap reste à quantifier sur du matériel réel déployé en conditions industrielles non contrôlées. La manipulation dextre constitue l'une des frontières les plus dures de la robotique, un domaine où des acteurs comme Dexterous Robotics, Shadow Robot (UK) ou Psyonic tentent d'atteindre la maturité produit. Côté recherche, les approches concurrentes s'appuient généralement sur la télé-opération (Pi-0 de Physical Intelligence, ACT, DROID dataset) ou sur des capteurs de profondeur calibrés. L'originalité de V2P-Manip est de contourner ces contraintes matérielles en exploitant uniquement la vision monoculaire. La validation reste pour l'instant confinée à des benchmarks académiques, et aucun déploiement ou partenariat industriel n'est annoncé dans cette version préliminaire.

RecherchePaper
1 source
Dex-X : manipulation dextérique visuo-tactile apprise à partir de vidéos humaines par interaction simulée
2arXiv cs.RO 

Dex-X : manipulation dextérique visuo-tactile apprise à partir de vidéos humaines par interaction simulée

Un article publié sur arXiv (arXiv:2609.07747v2) présente Dex-X, un framework qui entraîne des politiques de manipulation dextre visuo-tactile à partir de simples vidéos humaines monoculaires, sans collecte de données sur robot réel. Le système reconstruit en simulation les interactions main-objet filmées pour générer une supervision tactile physiquement cohérente, absente des vidéos d'origine, puis entraîne une politique "enseignante" distillée en une politique déployable utilisant nuages de points et capteurs tactiles. Sur une plateforme main-bras dextre, le transfert simulation-réel s'effectue en zero-shot sur des tâches de préhension et de manipulation d'outils à contact riche. La politique enseignante atteint 65,9% de réussite moyenne sur six catégories de tâches en simulation ; une fois distillée, elle affiche 93% de réussite en prise de cube réelle mais seulement 53% sur la tâche plus complexe de nettoyage de table, avec une généralisation zero-shot constatée sur des objets de géométries inédites. Le travail répond à une question clé pour le secteur : peut-on entraîner des politiques de manipulation dextre déployables à partir des vidéos humaines disponibles à l'échelle d'Internet, sans téléopération coûteuse pour collecter des données robot. Ces vidéos manquent justement du retour tactile indispensable aux tâches à contact riche, d'où l'idée de la simulation comme "moteur de complétion tactile", susceptible de réduire la dépendance des laboratoires aux campagnes de collecte coûteuses. L'écart entre 93% sur une tâche simple et 53% sur une tâche complexe rappelle toutefois que le sim-to-real reste loin d'être résolu à mesure que la manipulation se complexifie, une nuance qui vaut aussi pour les discours entourant les modèles visuo-langage-action génériques comme Pi-0 ou GR00T N2. La manipulation dextre multi-degrés-de-liberté reste un point dur de la robotique, plus exigeante en retour tactile que la préhension par pince industrielle classique, et les approches existantes reposent surtout sur la téléopération ou sur une simulation pure limitée par l'écart de réalisme physique avec le monde réel. Dex-X se positionne comme une voie intermédiaire, exploitant les vidéos humaines disponibles en masse plutôt que des démonstrations robot dédiées. L'article reste à ce stade une contribution académique publiée en version 2 sur arXiv, sans plateforme commerciale ni calendrier de déploiement annoncé, les auteurs indiquant vouloir étendre l'évaluation à davantage de tâches et de géométries d'objets.

RecherchePaper
1 source
UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines
3arXiv cs.RO 

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines

UniDex-ViTac, décrit dans un article arXiv de septembre 2026 (2609.16504), convertit des vidéos de démonstrations humaines en trajectoires robotiques simulées associées à des observations de contact au bout des doigts, via des spécialistes de renforcement résiduel qui adaptent, objet par objet, chaque interaction main-objet filmée à un bras-main robotique. À partir de 50 démonstrations humaines sur dix objets, les auteurs génèrent 10 000 trajectoires simulées pour entraîner une politique généraliste unique basée sur l'architecture Action Chunking with Transformers (ACT), combinant nuages de points, proprioception et quatre signaux de contact binaires par doigt, sans référence humaine ni pose d'objet connue au déploiement. En simulation, la version avec contact atteint 68,3% de réussite contre 55,5% pour une base vision seule ; sur robot réel, sans démonstration réelle ni réglage fin, elle réussit 73 essais sur 110 (66,4%) sur six objets vus et cinq inédits, contre 60 sur 110 (54,5%) pour la base de comparaison, un gain de 11,8 points. Le résultat vise un goulot d'étranglement connu de la manipulation dextre : le coût et la rareté des démonstrations robotiques réelles nécessaires à des politiques robustes. Qu'une politique entraînée uniquement en simulation, sans donnée robot réelle ni fine-tuning, réussisse plus de deux essais sur trois en conditions physiques alimente le débat sur la faisabilité du sim-to-real pour la manipulation fine avec retour tactile. L'ajout de simples signaux tactiles binaires, plutôt que des capteurs continus coûteux, améliore surtout la généralisation à des objets inédits, même si l'échantillon de 110 essais reste modeste pour en tirer des conclusions industrielles. Le travail s'inscrit dans une recherche plus large qui exploite les vidéos humaines non annotées pour contourner la téléopération, principal goulot d'étranglement de l'apprentissage par imitation en manipulation dextre. Sa contribution propre tient à la génération, par simulation physique, d'observations de contact absentes des vidéos humaines brutes, la comparaison avec une base vision seule isolant l'apport du signal tactile plutôt que celui de l'architecture ACT. L'article, accompagné d'une page projet (unidex-vitac.github.io), ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une preuve de faisabilité académique dont les suites attendues portent sur davantage d'objets, de tâches et une validation à plus grande échelle en conditions réelles.

RecherchePaper
1 source
C2Dex : reconstruction et retargeting cohérents avec le contact pour la manipulation dextérique à partir de vidéo monoculaire
4arXiv cs.RO 

C2Dex : reconstruction et retargeting cohérents avec le contact pour la manipulation dextérique à partir de vidéo monoculaire

Des chercheurs publient sur arXiv (arXiv:2608.07045v1) un article intitulé C2Dex, un framework qui transfère des démonstrations de manipulation extraites de simples vidéos monoculaires de mains humaines vers des robots à mains dextres. Le système repose sur une représentation partagée de contacts stables côté objet, reconstruits en agrégeant des observations bruitées image par image dans un espace canonique de l'objet. Ces contacts servent à la fois de contraintes de trajectoire pour stabiliser la reconstruction 3D de l'interaction main-objet humaine, et de cibles explicites pour le transfert vers la main robotique, via une optimisation laplacienne de l'interaction qui préserve la géométrie locale du contact malgré le changement de morphologie, puis un raffinement par apprentissage par renforcement résiduel en simulation. Sur les benchmarks DexYCB et TACO, C2Dex atteint des taux de réussite de trajectoire de bout en bout de 57,78% et 26,67% respectivement, contre 17,78% et 10% pour les meilleures méthodes de référence testées dans les mêmes conditions. Des essais de rejeu sur robot réel confirment la faisabilité physique des trajectoires générées sur des tâches de manipulation riches en contacts. Cette avancée s'attaque à un goulot d'étranglement central de la manipulation dextre : la collecte de démonstrations de qualité via téléopération ou capture de mouvement reste coûteuse et lente, alors que les vidéos humaines existent en abondance et à bas coût. Réussir à extraire de ces vidéos des trajectoires physiquement plausibles et transférables à des mains robotiques de morphologies différentes est jugé nécessaire pour entraîner à grande échelle des politiques de manipulation, dans la même logique que les modèles vision-langage-action utilisés par l'industrie humanoïde. Le gain observé face aux méthodes concurrentes, avec des taux de réussite multipliés par trois sur les deux jeux de données, suggère que l'instabilité des contacts reconstruits depuis la vidéo, jusqu'ici un frein majeur, peut être significativement atténuée. Les taux de réussite absolus restent toutefois modestes, en particulier sur TACO (26,67%), ce qui signale que le transfert vidéo vers robot dextre reste loin d'être résolu pour des tâches complexes. C2Dex s'inscrit dans un axe de recherche actif visant à exploiter les vidéos humaines comme source de données pour l'apprentissage par imitation en robotique, en complément ou substitut des démonstrations téléopérées. L'article, classé comme nouvelle soumission sur arXiv, n'a pas encore fait l'objet d'une publication évaluée par les pairs et ne décrit ni déploiement industriel ni intégration produit : il s'agit d'un travail de recherche comparé à des méthodes existantes de reconstruction d'interaction main-objet et de retargeting, jugées moins performantes dans les mêmes conditions d'évaluation. Une page projet dédiée met à disposition davantage de détails techniques et, potentiellement, des démonstrations vidéo. Les auteurs ne précisent pas de calendrier de suite des travaux, mais la démonstration sur robot réel laisse entrevoir une prochaine étape naturelle vers des évaluations en conditions moins contrôlées et sur un éventail plus large de tâches et de morphologies de mains robotiques.

RecherchePaper
1 source