Aller au contenu principal
RecherchearXiv cs.RO 

Skel-WAM : un modèle du monde conditionné par le squelette de la main pour le transfert humain-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 21 septembre 2026 sur arXiv (référence 2609.21514) Skel-WAM, un « world action model » qui transfère des démonstrations de manipulation filmées sur des humains vers le contrôle de robots, via une interface commune de squelette de main combinant superpositions squelettiques et points-clés 2.5-D. Un Video Expert et un Keypoint Expert apprennent conjointement la dynamique visuelle et squelettique dans une architecture Mixture-of-Transformers, tandis qu'un Action Expert entraîné uniquement sur des données robot traduit ces prédictions en commandes exécutables, sans nécessiter d'étiquettes d'action sur les vidéos humaines. Sur quatre tâches bimanuelles réelles et sept tâches simulées, le système atteint des taux de réussite moyens de 79,86 % et 63,29 %, devançant la meilleure référence de 22,22 et 8,28 points de pourcentage respectivement. Le co-entraînement humain-robot fait passer la réussite réelle sur des variantes de tâches absentes des données d'entraînement robot de 38,89 % à 86,11 %.

Ce résultat s'attaque à un goulot d'étranglement bien connu de la robotique manipulatrice : les démonstrations robot par téléopération sont coûteuses et couvrent mal la diversité des situations réelles, alors que la vidéo humaine est abondante mais souffre d'un écart d'incarnation entre corps humain et bras robotique. En montrant qu'un espace squelettique partagé suffit à superviser conjointement des données humaines et robotiques sans étiquette d'action, l'approche offre aux intégrateurs et laboratoires un moyen concret d'étendre la couverture de tâches d'une politique sans multiplier les campagnes de téléopération. Le bond observé sur les tâches inédites à l'entraînement robot, plus de 47 points grâce au cotraining, suggère que la vidéo humaine comble des trous de distribution plutôt que de simplement gonfler le volume de données, un argument concret dans le débat sur le passage à l'échelle des modèles vision-langage-action.

Ces travaux s'inscrivent dans une recherche active sur les world models et les architectures vision-langage-action, où l'écart entre démonstrations humaines et robotiques freine l'apprentissage par imitation à grande échelle. Il s'agit d'une publication arXiv récente, sans mention de revue par les pairs à ce stade, évaluée sur un périmètre restreint de laboratoire, ce qui invite à la prudence avant d'extrapoler ces chiffres à un déploiement industriel. L'article ne nomme aucune entreprise ni plateforme robotique commerciale et ne fixe aucun calendrier de transfert vers un produit ; la contribution reste pour l'instant méthodologique, mais elle rejoint un corpus croissant de travaux cherchant à exploiter la vidéo humaine comme source de données complémentaire pour entraîner des robots manipulateurs généralistes.

À lire aussi

Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement
1arXiv cs.RO 

Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement

Une équipe de recherche publie sur arXiv (2607.25798v1) un nouveau modèle baptisé Transformer Transformer, conçu pour la co-conception de robots conditionnée par le mouvement. L'idée : générer automatiquement des architectures robotiques complètes capables de suivre des trajectoires d'effecteur cibles issues de démonstrations humaines, tout en optimisant des fonctions de récompense définies par l'utilisateur. Le système repose sur les RoboTokens, une tokenisation unifiée des morphologies, états et actions des robots, qui permet à une seule architecture de diffusion transformer de fonctionner sur des espaces d'embodiment très différents : robots bimanuels à roues, quadrupèdes, humanoïdes. Plutôt que d'optimiser pour une récompense unique, le modèle agit comme un modèle de dynamique générique, dont les prédictions d'état et d'action servent ensuite à calculer des valeurs spécifiques à chaque objectif, via une procédure nommée Dynamics Self-Guidance qui guide la diffusion vers des designs à haute valeur. Preuve concrète : les chercheurs ont fabriqué une version optimisée de la plateforme ALOHA, réduisant l'erreur de suivi de trajectoire de plus de 70 % par rapport au design d'origine. L'intérêt pour le secteur tient à ce que la conception mécanique des robots reste largement découplée du contrôle et de l'apprentissage, alors que la performance en manipulation dépend fortement de l'embodiment. Un modèle capable d'optimiser en zero-shot pour des récompenses et trajectoires jamais vues, plus rapidement qu'une baseline évolutionniste, ouvre la voie à des cycles de co-conception matériel-logiciel beaucoup plus rapides pour les intégrateurs et les fabricants de bras ou de plateformes bimanuelles. C'est un signal supplémentaire que les architectures de type transformer/diffusion, déjà dominantes pour les politiques VLA, s'étendent maintenant à la conception physique elle-même, et pas seulement au contrôle. Le travail s'inscrit dans la lignée de la recherche sur la co-conception robotique, historiquement dominée par des algorithmes évolutionnistes coûteux en calcul et spécifiques à une seule récompense. ALOHA, plateforme bimanuelle open source popularisée par les travaux de Stanford et Google, sert ici de banc d'essai matériel concret plutôt que de simple simulation. Le papier ne précise pas de calendrier de déploiement industriel ni de partenaire, il s'agit à ce stade d'un résultat de recherche fraîchement publié, dont la portée reste à confirmer sur des espaces de conception plus larges.

RecherchePaper
1 source
OSCAR : modèle d'action du monde conditionné par squelette pour robots à morphologies multiples
2arXiv cs.RO 

OSCAR : modèle d'action du monde conditionné par squelette pour robots à morphologies multiples

Des chercheurs ont publié OSCAR (Omni-Embodiment Skeleton-Conditioned World Action Model), un modèle de monde vidéo conditionné par les actions, capable de généraliser à travers différentes morphologies de robots. Décrit dans un preprint arXiv (2606.04463), le système s'appuie sur deux éléments centraux : un pipeline de données à grande échelle qui agrège, filtre et déduplique des jeux de données robotiques et des séquences vidéo égocentrées humaines pour couvrir des tâches, scénarios et morphologies variés ; et un conditionnement par rendu de squelette cinématique 2D, représentation unifiée fonctionnant aussi bien pour des bras robotiques de morphologies différentes que pour des mains humaines. Le modèle de base Cosmos-Predict2.5-2B de NVIDIA a été fine-tuné sur un seul GPU GH200. OSCAR a ensuite été déployé pour évaluer des politiques de contrôle issues de RoboArena, plateforme de benchmark communautaire, et démontre une corrélation significative entre évaluations virtuelles et tests en conditions réelles. L'enjeu central est le sim-to-real gap dans l'évaluation des policies : les environnements de simulation classiques reproduisent mal la physique réelle, rendant les benchmarks peu prédictifs du comportement sur robot physique. OSCAR propose une alternative directe, générer des vidéos conditionnées par les trajectoires d'actions pour simuler l'exécution d'une politique sans déploiement matériel. Si la corrélation annoncée se confirme à plus grande échelle, cela réduirait significativement les coûts et les cycles d'itération pour les équipes développant des VLA (Vision-Language-Action models). La représentation par squelette 2D est également notable : en évitant une spécialisation par embodiment, elle adresse un blocage récurrent de la généralisation multi-robot. Le fine-tuning sur GPU unique, contre des baselines nécessitant des modèles plus grands ou davantage de ressources de calcul, améliore l'accessibilité de l'approche. Les video world models appliqués à la robotique constituent un domaine en forte compétition : UniSim, RoboDreamer et le World Model de 1X Technologies ont chacun tenté d'adresser la simulation vidéo pour l'entraînement ou l'évaluation de robots, avec des résultats limités en diversité de scénarios ou en généralisation inter-embodiment. Le recours au modèle Cosmos de NVIDIA comme base pré-entraînée positionne OSCAR dans l'écosystème robotique croissant de NVIDIA, qui comprend Isaac Lab et GR00T. Les auteurs ouvrent explicitement la perspective d'une évaluation purement virtuelle des politiques robots, une proposition qui intéresse directement les intégrateurs cherchant à réduire les cycles de test hardware. Les étapes naturelles seraient la validation sur des morphologies plus variées, des tâches de manipulation complexes, et un passage à l'échelle vers des configurations multi-GPU.

RechercheOpinion
1 source
DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique
3arXiv cs.RO 

DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique

DexTouch-WM, publié en preprint sur arXiv (2609.20649v1), est un modèle du monde conditionné par l'action qui prédit conjointement les images RGB futures et la dynamique tactile bilatérale pour la manipulation dextre robotique. Il s'appuie sur des réseaux de capteurs piézorésistifs flexibles montés selon un schéma identique sur des mains humaines et robotiques, rendant leurs signaux tactiles directement comparables. Le mouvement humain est retranscrit dans l'espace d'action du robot, permettant à des démonstrations tactiles humaines de superviser le même modèle de dynamique que celui utilisé sur robot réel. L'architecture associe un vidéo expert pré-entraîné à un tactile expert léger via des tokens tenant compte de l'anatomie de la main. Les auteurs fixent cinq heures de données robot réel et font varier les données tactiles humaines de zéro à cent heures. Les tâches humaines et robotiques utilisées à l'entraînement étant disjointes, l'amélioration observée sur les prédictions visuelles, géométriques et de contact en domaine robot suggère un transfert réel des dynamiques de contact entre les deux embodiments. Cela vise le principal goulot d'étranglement de la manipulation dextre en contact riche: la collecte de données tactiles reste lente, coûteuse et liée à un capteur et un robot spécifiques. En montrant qu'une supervision tactile humaine, bien plus facile à collecter en volume, complète un budget de données robot limité, les auteurs proposent un axe de données alternatif à la téléopération ou à la simulation pure, utile pour entraîner des politiques de manipulation à plus grande échelle. Ce travail prolonge les modèles du monde vidéo déjà employés en robotique comme substituts de simulation, en y ajoutant une dynamique tactile bilatérale explicite, un axe encore peu exploité face à la vision et au langage dans la manipulation dextre. Il se positionne face aux approches misant uniquement sur la téléopération robot ou la simulation physique pour générer des données de contact. Publié comme preprint arXiv sans annonce de déploiement, de partenariat industriel ou de calendrier commercial, il reste une contribution de recherche: les auteurs présentent l'évaluation en environnement de substitution et la génération de trajectoires synthétiques pour l'apprentissage de politiques comme des pistes ouvertes plutôt que comme un système prêt à l'emploi.

RecherchePaper
1 source
DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique
4arXiv cs.RO 

DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique

DreamX-Phi 1.0, un modèle de monde vidéo conditionné par l'action pour la manipulation robotique, est présenté dans un article déposé sur arXiv (2608.13489v1). À partir d'une image observée, d'une instruction en langage naturel et d'une séquence d'actions prescrite, poses de l'effecteur terminal et états du gripper, le système prédit les observations vidéo futures correspondantes. Pour éviter qu'une vidéo réaliste en apparence déplace le mauvais bras ou fasse disparaître l'objet manipulé, les auteurs injectent des transformations géométriques SE(3) propres à chaque bras dans les couches d'attention via un encodage de type PRoPE, complété par une branche de profondeur pour la géométrie de la scène et des masques SAM3 associés à un modèle enseignant V-JEPA figé pour maintenir la cohérence des objets durant la saisie. Le générateur multi-étapes est ensuite distillé en un modèle étudiant à peu d'étapes pour accélérer le déploiement. Le modèle revendique la première place sur la Track 1 et la deuxième sur la Track 2 du WorldArena 2.0 Challenge, avec publication annoncée du modèle et du code. Cette approche s'attaque à un problème central des modèles de monde appliqués à la robotique: une vidéo générée peut paraître photoréaliste tout en étant physiquement incohérente avec les commandes envoyées au robot, ce qui invalide son usage pour l'entraînement de politiques ou la planification. En ancrant la génération vidéo sur la géométrie rigide réelle de chaque bras et en préservant l'identité des objets manipulés, DreamX-Phi cherche à combler l'écart entre démonstration visuelle convaincante et fidélité exploitable pour le contrôle. La distillation en modèle étudiant à peu d'étapes répond à une contrainte pratique bien connue des intégrateurs: les modèles de monde vidéo multi-étapes sont souvent trop lents pour une boucle de contrôle temps réel, ce qui limite sinon leur usage à la simulation ou à l'évaluation hors ligne. Le classement sur WorldArena 2.0 reste toutefois un résultat de benchmark académique et non une validation en conditions réelles sur un robot physique. DreamX-Phi s'inscrit dans une vague plus large de modèles de monde vidéo pour la robotique, qui cherchent à compléter ou remplacer les architectures vision-langage-action comme Pi-0 ou GR00T N2 par une simulation générative directe des conséquences d'une action. Le recours à SAM3 pour la segmentation et à V-JEPA comme enseignant figé situe le projet dans la lignée des modèles de représentation vidéo auto-supervisés récents plutôt que dans une pile propriétaire fermée. À ce stade, aucune information ne mentionne de déploiement sur un robot physique ni de partenariat industriel: il s'agit d'un article de recherche accompagné d'un résultat de compétition, le modèle et le code étant seulement annoncés comme à venir. La suite logique, si cette promesse de publication est tenue, sera l'adoption du modèle comme brique de simulation ou d'évaluation par d'autres équipes travaillant sur la manipulation robotique.

RecherchePaper
1 source