SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace
Des chercheurs publient sur arXiv (2610.02120) SkeleWAM, un modèle « world action » (WAM) compact pour la manipulation robotique. Un WAM combine la génération d'actions du robot avec la prédiction d'états futurs. La plupart des WAM existants prédisent des vidéos ou des latents visuels appris. Le nouveau modèle représente plutôt la scène sous la forme d'un squelette 3D épars, composé des articulations du robot, des centres d'objets et de points d'interaction. Ce squelette est construit en ligne à partir des images RGB-D courantes et de la proprioception du robot. Il sert d'état géométrique unique pour générer les actions et prédire les squelettes futurs, ce qui apporte une supervision géométrique supplémentaire sans reconstruction visuelle. À l'inférence, le modèle produit les actions directement depuis le squelette courant et l'instruction en langage naturel. Une stratégie auxiliaire, Medoid Action Consensus (MAC), sélectionne parmi plusieurs échantillons d'actions stochastiques un consensus représentatif. Sur le benchmark LIBERO-Plus, SkeleWAM atteint 85,9 % de réussite globale avec 57,1 millions de paramètres, soit 3,7 points de plus que Cosmos-Policy.
L'intérêt tient au compromis entre performance et taille. Les WAM fondés sur la vidéo ou sur des latents visuels portent des informations d'apparence sans rapport avec le contrôle et ne codent la géométrie d'interaction qu'implicitement. Avec 57,1 M de paramètres, SkeleWAM se situe très en dessous des modèles de fondation de type VLA, qui comptent en général plusieurs milliards de paramètres. Si l'approche tient hors benchmark, elle ouvre la voie à des politiques embarquables sur du calcul modeste, un point décisif pour les intégrateurs qui visent des cellules industrielles sans GPU lourd. Elle suggère aussi qu'un état structuré, centré sur les relations robot-objet, peut suffire à remplacer la prédiction de pixels. Des réserves s'imposent : LIBERO-Plus est un benchmark en simulation, qui évalue la robustesse à des perturbations, et l'écart de 3,7 points reste modeste. Aucun test sur robot réel n'est mentionné dans le résumé. Enfin, la construction du squelette suppose une perception RGB-D fiable, ce qui déplace une partie de la difficulté vers l'estimation des centres d'objets et des points d'interaction en conditions réelles.
SkeleWAM s'inscrit dans la montée des world action models, qui cherchent à marier politique et modèle du monde, avec Cosmos-Policy comme référence directe de la comparaison. La tendance dominante a consisté à prédire des vidéos futures, coûteuses en calcul. Les travaux récents explorent des représentations plus sobres, géométriques ou latentes, pour réduire ce coût. Les auteurs publient une page de projet (skelewam-project.github.io). La suite logique serait une validation sur matériel réel, sur des tâches variées et dans des environnements encombrés, ainsi qu'une comparaison avec les grands VLA sur des benchmarks complémentaires. Il s'agit pour l'instant d'une préimpression, sans produit ni déploiement associé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




