OmniHOI : interaction main-objet dextérique à partir d'une vidéo humaine monoculaire
OmniHOI, un pipeline présenté sur arXiv (2610.10855), transforme une simple vidéo RGB monoculaire d'interaction main-objet en trajectoire exécutable par des mains robotiques dextres. Il enchaîne trois étapes, chacune contrainte par la preuve disponible à son niveau: l'image pendant la reconstruction, la géométrie de contact pendant le retargeting, puis la dynamique lors d'un raffinement avec simulation physique dans la boucle. Les auteurs testent d'abord 150 trajectoires de motion capture transférées vers cinq mains dextres de 6 à 22 DoF, avec 39 à 89 % de succès contre 31 % au mieux pour les méthodes de transfert antérieures. Sur 60 clips vidéo monoculaires, le taux de réussite atteint 53 %, contre 28 % pour le meilleur pipeline vidéo-vers-robot existant. Les trajectoires produites sont aussi exécutées sur un robot bimanuel réel, sur plusieurs tâches.
L'enjeu est l'accès aux données. Les vidéos de manipulation humaine abondent, mais les exploiter pour entraîner ou piloter des mains robotiques butte sur deux écueils: les approches reposant sur l'apprentissage par renforcement propre à chaque tâche passent mal à l'échelle, tandis que celles qui supposent des trajectoires de motion capture propres ne fonctionnent pas sur de la vidéo ordinaire. En corrigeant les erreurs à chaque étape plutôt que de les laisser se propager jusqu'à une politique apprise, OmniHOI vise à rendre la vidéo humaine directement exploitable comme source de démonstrations dextres. Les chiffres appellent toutefois à la prudence. Un succès de 53 % sur 60 clips reste modeste pour un usage industriel, la fourchette de 39 à 89 % selon la main montre une forte dépendance à la morphologie, et l'article ne précise ni la diversité des tâches ni la nature de la validation sur robot réel, qui semble qualitative. Il s'agit d'un résultat de recherche, sans produit ni déploiement.
Ce travail s'inscrit dans la course à la donnée pour la manipulation dextre. Plusieurs acteurs misent sur la téléopération, les gants ou les exosquelettes, qui donnent des données propres mais coûteuses. D'autres cherchent à exploiter les vidéos humaines à grande échelle, ce qui suppose de résoudre l'écart de morphologie entre la main humaine et des mains robotiques très variées. OmniHOI se positionne comme une couche intermédiaire indépendante de la main cible, face à des méthodes soit spécialisées par tâche, soit limitées aux données de capture de mouvement. La suite logique serait de tester ces trajectoires comme données d'entraînement pour des politiques de type VLA, et de mesurer le taux de succès sur des tâches plus longues et plus variées. Le papier est une prépublication v1, non évaluée par des pairs, et aucun calendrier de code ou de déploiement n'est mentionné.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




