Aller au contenu principal
RecherchearXiv cs.RO 

SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02120) SkeleWAM, un modèle « world action » (WAM) compact pour la manipulation robotique. Un WAM combine la génération d'actions du robot avec la prédiction d'états futurs. La plupart des WAM existants prédisent des vidéos ou des latents visuels appris. Le nouveau modèle représente plutôt la scène sous la forme d'un squelette 3D épars, composé des articulations du robot, des centres d'objets et de points d'interaction. Ce squelette est construit en ligne à partir des images RGB-D courantes et de la proprioception du robot. Il sert d'état géométrique unique pour générer les actions et prédire les squelettes futurs, ce qui apporte une supervision géométrique supplémentaire sans reconstruction visuelle. À l'inférence, le modèle produit les actions directement depuis le squelette courant et l'instruction en langage naturel. Une stratégie auxiliaire, Medoid Action Consensus (MAC), sélectionne parmi plusieurs échantillons d'actions stochastiques un consensus représentatif. Sur le benchmark LIBERO-Plus, SkeleWAM atteint 85,9 % de réussite globale avec 57,1 millions de paramètres, soit 3,7 points de plus que Cosmos-Policy.

L'intérêt tient au compromis entre performance et taille. Les WAM fondés sur la vidéo ou sur des latents visuels portent des informations d'apparence sans rapport avec le contrôle et ne codent la géométrie d'interaction qu'implicitement. Avec 57,1 M de paramètres, SkeleWAM se situe très en dessous des modèles de fondation de type VLA, qui comptent en général plusieurs milliards de paramètres. Si l'approche tient hors benchmark, elle ouvre la voie à des politiques embarquables sur du calcul modeste, un point décisif pour les intégrateurs qui visent des cellules industrielles sans GPU lourd. Elle suggère aussi qu'un état structuré, centré sur les relations robot-objet, peut suffire à remplacer la prédiction de pixels. Des réserves s'imposent : LIBERO-Plus est un benchmark en simulation, qui évalue la robustesse à des perturbations, et l'écart de 3,7 points reste modeste. Aucun test sur robot réel n'est mentionné dans le résumé. Enfin, la construction du squelette suppose une perception RGB-D fiable, ce qui déplace une partie de la difficulté vers l'estimation des centres d'objets et des points d'interaction en conditions réelles.

SkeleWAM s'inscrit dans la montée des world action models, qui cherchent à marier politique et modèle du monde, avec Cosmos-Policy comme référence directe de la comparaison. La tendance dominante a consisté à prédire des vidéos futures, coûteuses en calcul. Les travaux récents explorent des représentations plus sobres, géométriques ou latentes, pour réduire ce coût. Les auteurs publient une page de projet (skelewam-project.github.io). La suite logique serait une validation sur matériel réel, sur des tâches variées et dans des environnements encombrés, ainsi qu'une comparaison avec les grands VLA sur des benchmarks complémentaires. Il s'agit pour l'instant d'une préimpression, sans produit ni déploiement associé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)
1arXiv cs.RO 

Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)

Une équipe de recherche a publié le 22 septembre 2026 sur arXiv, sous la référence 2609.22332, AffordanceWAM, un nouveau modèle conjoint de monde et d'action pour la manipulation robotique généraliste. Bâti sur un Transformer de diffusion vidéo pré-entraîné, il associe un module « World Expert » et un module « Action Expert » reliés par une attention conjointe masquée, pour prédire simultanément les images RGB futures de la scène, un champ d'affordance scalaire, une carte de chaleur des zones manipulables et la trajectoire d'action continue du robot, sous un objectif d'entraînement unique de type flow-matching. Les vidéos humaines filmées à la première personne supervisent ces trois flux visuels, tandis que les démonstrations robotiques ajoutent la supervision d'action, sans retargeting ni étiquetage manuel des gestes humains, avant validation sur les bancs d'essai RoboCasa et CALVIN (protocole ABC vers D) et sur des tâches de manipulation réelles. Le problème visé est la pénurie de données d'entraînement pour les politiques vision-langage-action : les vidéos robot avec actions étiquetées restent coûteuses et peu diversifiées, tandis que les vidéos humaines égocentriques, abondantes, manquent d'actions robotiques exploitables et diffèrent en morphologie. AffordanceWAM affiche des gains constants face à des références limitées au RGB seul ou aux seules données robot, et surtout une amélioration monotone sur RoboCasa à mesure que le volume de vidéos humaines annotées en affordance augmente, à supervision robot constante. Pour les équipes entraînant des modèles VLA à grande échelle, ce résultat trace une voie pour réduire la dépendance à la téléopération coûteuse en exploitant des corpus vidéo humains déjà disponibles en masse. Le travail s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où prédiction vidéo et génération d'action sont fusionnées dans une architecture unique plutôt que traitées séparément, une direction également suivie par plusieurs laboratoires industriels développant des modèles vision-langage-action. Il s'agit à ce stade d'une prépublication non encore validée par relecture par les pairs, testée sur des bancs d'essai académiques et un nombre restreint de scénarios réels, et non d'un produit ou d'un déploiement commercial. Le papier ne précise ni la taille exacte des corpus vidéo humains, ni de calendrier de publication du code ou des poids du modèle, laissant la reproductibilité comme prochaine étape à vérifier.

RechercheActu
1 source
SkelWAM : un modèle du monde et de l'action guidé par squelette pour la manipulation en zéro-shot inter-incarnations
2arXiv cs.RO 

SkelWAM : un modèle du monde et de l'action guidé par squelette pour la manipulation en zéro-shot inter-incarnations

Une équipe de recherche présente SkelWAM, un modèle monde-action guidé par une représentation squelettique qui transfère des compétences de manipulation d'un robot source vers un robot cible différent, sans nouvelle démonstration. Le système encode la géométrie du bras, la pose du point central de l'outil (TCP) et les commandes de pince parallèle dans un état partagé à 25 dimensions, utilisé à la fois pour les observations et pour les actions du corps entier. Un mélange de transformeurs vidéo-action génère ces actions, converties ensuite en commandes articulaires ou en commandes pour robot continuum. Sur le nouveau benchmark LIBERO-Cross10 (dix tâches, dix robots cibles, quatre familles morphologiques), une version entraînée sur un bras Franka obtient 43,3% de réussite sur 1000 épisodes, soit 36,2 points de plus que la meilleure méthode comparée. Une politique entraînée sur un bras JAKA mini2 a aussi été transférée vers le robot continuum Feagine A03, pour trois tâches de manipulation sur table. Ce travail s'attaque à un verrou économique du secteur robotique : la réutilisation de politiques de manipulation d'un robot à l'autre sans nouvelle collecte de données, un frein majeur au déploiement à grande échelle des modèles vision-langage-action (VLA) du type Pi-0 ou GR00T N2. Sans correspondance articulation par articulation ni démonstration sur la tâche cible, l'approche promet de réduire le coût d'adaptation pour les intégrateurs qui exploitent des flottes hétérogènes, bras industriels et robots continuum compris. Le gain de 36,2 points sur les méthodes comparées est net, mais un taux de réussite de 43,3% reste loin d'un niveau exploitable en production, ce qui rappelle que le transfert cross-embodiment demeure un problème largement ouvert malgré ces progrès. L'approche s'inscrit dans la lignée des modèles vision-langage-action généralistes comme Pi-0 ou GR00T N2, mais s'en distingue par une représentation géométrique explicite du bras plutôt qu'un espace d'action appris implicitement. Le benchmark LIBERO-Cross10, introduit avec ce travail, comble l'absence de protocole standardisé pour comparer les méthodes de transfert cross-embodiment. Aucun acteur européen n'apparaît dans cette publication, centrée sur des plateformes Franka, JAKA et Feagine. Au-delà de la démonstration sur le robot continuum Feagine A03, les auteurs ne mentionnent aucun pilote industriel ni calendrier de déploiement : il s'agit pour l'instant d'un résultat de recherche accompagné d'une page projet, sans partenariat commercial annoncé.

RecherchePaper
1 source
Token-World : modélisation du monde dans l'espace de jetons d'un modèle vision-langage pour la manipulation robotique
3arXiv cs.RO 

Token-World : modélisation du monde dans l'espace de jetons d'un modèle vision-langage pour la manipulation robotique

Des chercheurs publient sur arXiv (2610.00575) Token-World, un modèle du monde conditionné par l'action, conçu pour les systèmes vision-langage-action (VLA) en manipulation robotique. La plupart des simulateurs actuels prédisent les futures images RGB, puis les ré-encodent pour la politique de contrôle. Token-World évite ce détour. Il compresse les tokens visuels d'un modèle vision-langage (VLM) en un état compact. Il apprend la dynamique future dans cet espace réduit, puis reconvertit les états prédits vers la représentation d'origine que consomme la politique. Sur plusieurs benchmarks de manipulation, les auteurs annoncent une meilleure fidélité des features en boucle ouverte et une meilleure cohérence des actions de la politique que les simulateurs récents. La dégradation est aussi plus lente sur de longs horizons de rollout. En boucle fermée, la performance simulée corrèle davantage avec celle de la politique de référence que Ctrl-World (r = 0,794 contre 0,583), avec une latence de simulation plus faible. Le code est annoncé, pas encore publié. L'enjeu est l'évaluation des politiques robotiques, aujourd'hui l'un des principaux goulots d'étranglement des VLA. Tester une politique sur robot réel coûte cher et prend du temps. Un simulateur appris et fiable permettrait de comparer des checkpoints et d'itérer sans immobiliser de matériel. Le gain de corrélation (0,794 contre 0,583) reste modeste en valeur absolue. Un coefficient proche de 0,8 classe correctement les politiques en gros, mais il n'est pas assez fin pour trancher entre deux variantes proches. L'intérêt de l'approche est aussi pratique, puisqu'elle supprime la génération de pixels, étape coûteuse en calcul. Elle suppose en revanche que le simulateur reste lié à la représentation d'un VLM donné. Les résultats viennent de benchmarks et non d'un déploiement industriel. Rien ne dit encore comment la méthode se comporte avec des contacts riches, des objets déformables ou des scènes hors distribution, ni sur quels robots ni avec quels volumes de données elle a été validée. Ce travail s'inscrit dans la vague des modèles du monde pour la robotique, où des systèmes comme Ctrl-World, la référence directe ici, génèrent des vidéos conditionnées par l'action pour évaluer ou améliorer des politiques. Le débat porte sur la nécessité de reconstruire des pixels pour planifier ou évaluer, alors que les politiques VLA de type Pi-0 ou GR00T travaillent déjà sur des représentations latentes. Token-World est une publication académique en préimpression, sans évaluation par les pairs. Il ne s'agit ni d'un produit ni d'un déploiement. La suite dépendra de la publication du code et d'une reproduction indépendante, notamment sur robot réel et sur des politiques tierces.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
4arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source