RLHND : des modèles fondation vidéo comme suiveurs de mains ancrés dans la physique pour l'apprentissage des robots
Des chercheurs présentent RLHND, un modèle de suivi de la main (hand tracking) qui estime conjointement la pose de la main et des informations tactiles réalistes à partir de vidéos égocentriques monoculaires, c'est-à-dire filmées du point de vue de l'opérateur avec une seule caméra. Le système réutilise le backbone de diffusion vidéo pré-entraîné Cosmos 3 comme extracteur de caractéristiques déterministe au niveau du clip, grâce à un conditionnement par « latent propre » (clean-latent conditioning). Pour la pose, il prédit des angles articulaires anatomiquement plausibles et accepte en option un paramètre de forme, ce qui maintient une morphologie de main cohérente dans une même vidéo, voire entre plusieurs vidéos du même acteur. Pour le tactile, un flux « expert » distinct, entraîné pendant que le flux de pose est gelé, prédit les contacts et les forces denses sur la surface de la main. Une propagation de caractéristiques fondée sur le LBS (linear blend skinning) permet d'extraire des attributs par sommet sans attention coûteuse sur chacun d'eux. Les auteurs revendiquent l'état de l'art sur plusieurs benchmarks de pose, ainsi que sur l'estimation du contact et de la force, et fournissent des résultats de retargeting et des expériences sur robot réel. Le code doit être publié.
L'enjeu touche directement l'entraînement de politiques robotiques à partir de vidéos humaines, une approche qui se généralise. Le maillon faible y est la qualité des données : les trackers classiques régressent la pose à partir d'images recadrées, avec peu d'a priori sur la dynamique de la main et l'interaction avec les objets. Ils produisent des estimations imprécises et physiquement incohérentes, qui se propagent ensuite dans les actions retargetées vers une main robotique. Ajouter contact et force comble un manque majeur, car la manipulation fine dépend de ces signaux que la vidéo seule n'expose pas. Si les gains se confirment, des vidéos égocentriques ordinaires, bien moins coûteuses que la téléopération ou les gants instrumentés, deviendraient une source de supervision plus exploitable. Le travail suggère aussi que les modèles de fondation vidéo, souvent présentés comme des modèles du monde, peuvent servir de perception physiquement informée, au-delà de la génération. Quelques réserves : il s'agit d'une prépublication arXiv non évaluée par les pairs, les chiffres précis ne figurent pas dans le résumé, l'ampleur des essais robotiques n'est pas détaillée, et la vérité terrain de force reste difficile à obtenir hors laboratoire, ce qui pose la question de la généralisation.
Ce travail s'inscrit dans la montée des méthodes qui apprennent des mains humaines filmées pour alimenter des modèles vision-langage-action (VLA) et des mains dextres. Il prolonge la lignée des estimateurs de pose de main à partir d'images isolées, et reprend l'idée de détourner les modèles vidéo génératifs de la famille Cosmos, développée par NVIDIA, vers des tâches de perception. Les acteurs de la robotique humanoïde cherchent à passer à l'échelle leurs données de manipulation sans multiplier les opérateurs en téléopération, et un suivi de main fiable avec signaux tactiles répond à ce besoin. La suite dépendra de la publication du code annoncée sur la page du projet, de reproductions indépendantes et de démonstrations sur des tâches de manipulation plus longues et plus variées.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




