Skel-WAM : un modèle du monde conditionné par le squelette de la main pour le transfert humain-robot
Des chercheurs ont publié le 21 septembre 2026 sur arXiv (référence 2609.21514) Skel-WAM, un « world action model » qui transfère des démonstrations de manipulation filmées sur des humains vers le contrôle de robots, via une interface commune de squelette de main combinant superpositions squelettiques et points-clés 2.5-D. Un Video Expert et un Keypoint Expert apprennent conjointement la dynamique visuelle et squelettique dans une architecture Mixture-of-Transformers, tandis qu'un Action Expert entraîné uniquement sur des données robot traduit ces prédictions en commandes exécutables, sans nécessiter d'étiquettes d'action sur les vidéos humaines. Sur quatre tâches bimanuelles réelles et sept tâches simulées, le système atteint des taux de réussite moyens de 79,86 % et 63,29 %, devançant la meilleure référence de 22,22 et 8,28 points de pourcentage respectivement. Le co-entraînement humain-robot fait passer la réussite réelle sur des variantes de tâches absentes des données d'entraînement robot de 38,89 % à 86,11 %.
Ce résultat s'attaque à un goulot d'étranglement bien connu de la robotique manipulatrice : les démonstrations robot par téléopération sont coûteuses et couvrent mal la diversité des situations réelles, alors que la vidéo humaine est abondante mais souffre d'un écart d'incarnation entre corps humain et bras robotique. En montrant qu'un espace squelettique partagé suffit à superviser conjointement des données humaines et robotiques sans étiquette d'action, l'approche offre aux intégrateurs et laboratoires un moyen concret d'étendre la couverture de tâches d'une politique sans multiplier les campagnes de téléopération. Le bond observé sur les tâches inédites à l'entraînement robot, plus de 47 points grâce au cotraining, suggère que la vidéo humaine comble des trous de distribution plutôt que de simplement gonfler le volume de données, un argument concret dans le débat sur le passage à l'échelle des modèles vision-langage-action.
Ces travaux s'inscrivent dans une recherche active sur les world models et les architectures vision-langage-action, où l'écart entre démonstrations humaines et robotiques freine l'apprentissage par imitation à grande échelle. Il s'agit d'une publication arXiv récente, sans mention de revue par les pairs à ce stade, évaluée sur un périmètre restreint de laboratoire, ce qui invite à la prudence avant d'extrapoler ces chiffres à un déploiement industriel. L'article ne nomme aucune entreprise ni plateforme robotique commerciale et ne fixe aucun calendrier de transfert vers un produit ; la contribution reste pour l'instant méthodologique, mais elle rejoint un corpus croissant de travaux cherchant à exploiter la vidéo humaine comme source de données complémentaire pour entraîner des robots manipulateurs généralistes.
Dans nos dossiers




