SkelWAM : un modèle du monde et de l'action guidé par squelette pour la manipulation en zéro-shot inter-incarnations
Une équipe de recherche présente SkelWAM, un modèle monde-action guidé par une représentation squelettique qui transfère des compétences de manipulation d'un robot source vers un robot cible différent, sans nouvelle démonstration. Le système encode la géométrie du bras, la pose du point central de l'outil (TCP) et les commandes de pince parallèle dans un état partagé à 25 dimensions, utilisé à la fois pour les observations et pour les actions du corps entier. Un mélange de transformeurs vidéo-action génère ces actions, converties ensuite en commandes articulaires ou en commandes pour robot continuum. Sur le nouveau benchmark LIBERO-Cross10 (dix tâches, dix robots cibles, quatre familles morphologiques), une version entraînée sur un bras Franka obtient 43,3% de réussite sur 1000 épisodes, soit 36,2 points de plus que la meilleure méthode comparée. Une politique entraînée sur un bras JAKA mini2 a aussi été transférée vers le robot continuum Feagine A03, pour trois tâches de manipulation sur table.
Ce travail s'attaque à un verrou économique du secteur robotique : la réutilisation de politiques de manipulation d'un robot à l'autre sans nouvelle collecte de données, un frein majeur au déploiement à grande échelle des modèles vision-langage-action (VLA) du type Pi-0 ou GR00T N2. Sans correspondance articulation par articulation ni démonstration sur la tâche cible, l'approche promet de réduire le coût d'adaptation pour les intégrateurs qui exploitent des flottes hétérogènes, bras industriels et robots continuum compris. Le gain de 36,2 points sur les méthodes comparées est net, mais un taux de réussite de 43,3% reste loin d'un niveau exploitable en production, ce qui rappelle que le transfert cross-embodiment demeure un problème largement ouvert malgré ces progrès.
L'approche s'inscrit dans la lignée des modèles vision-langage-action généralistes comme Pi-0 ou GR00T N2, mais s'en distingue par une représentation géométrique explicite du bras plutôt qu'un espace d'action appris implicitement. Le benchmark LIBERO-Cross10, introduit avec ce travail, comble l'absence de protocole standardisé pour comparer les méthodes de transfert cross-embodiment. Aucun acteur européen n'apparaît dans cette publication, centrée sur des plateformes Franka, JAKA et Feagine. Au-delà de la démonstration sur le robot continuum Feagine A03, les auteurs ne mentionnent aucun pilote industriel ni calendrier de déploiement : il s'agit pour l'instant d'un résultat de recherche accompagné d'une page projet, sans partenariat commercial annoncé.
Dans nos dossiers




