Aller au contenu principal
RecherchearXiv cs.RO 

SkelWAM : un modèle du monde et de l'action guidé par squelette pour la manipulation en zéro-shot inter-incarnations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente SkelWAM, un modèle monde-action guidé par une représentation squelettique qui transfère des compétences de manipulation d'un robot source vers un robot cible différent, sans nouvelle démonstration. Le système encode la géométrie du bras, la pose du point central de l'outil (TCP) et les commandes de pince parallèle dans un état partagé à 25 dimensions, utilisé à la fois pour les observations et pour les actions du corps entier. Un mélange de transformeurs vidéo-action génère ces actions, converties ensuite en commandes articulaires ou en commandes pour robot continuum. Sur le nouveau benchmark LIBERO-Cross10 (dix tâches, dix robots cibles, quatre familles morphologiques), une version entraînée sur un bras Franka obtient 43,3% de réussite sur 1000 épisodes, soit 36,2 points de plus que la meilleure méthode comparée. Une politique entraînée sur un bras JAKA mini2 a aussi été transférée vers le robot continuum Feagine A03, pour trois tâches de manipulation sur table.

Ce travail s'attaque à un verrou économique du secteur robotique : la réutilisation de politiques de manipulation d'un robot à l'autre sans nouvelle collecte de données, un frein majeur au déploiement à grande échelle des modèles vision-langage-action (VLA) du type Pi-0 ou GR00T N2. Sans correspondance articulation par articulation ni démonstration sur la tâche cible, l'approche promet de réduire le coût d'adaptation pour les intégrateurs qui exploitent des flottes hétérogènes, bras industriels et robots continuum compris. Le gain de 36,2 points sur les méthodes comparées est net, mais un taux de réussite de 43,3% reste loin d'un niveau exploitable en production, ce qui rappelle que le transfert cross-embodiment demeure un problème largement ouvert malgré ces progrès.

L'approche s'inscrit dans la lignée des modèles vision-langage-action généralistes comme Pi-0 ou GR00T N2, mais s'en distingue par une représentation géométrique explicite du bras plutôt qu'un espace d'action appris implicitement. Le benchmark LIBERO-Cross10, introduit avec ce travail, comble l'absence de protocole standardisé pour comparer les méthodes de transfert cross-embodiment. Aucun acteur européen n'apparaît dans cette publication, centrée sur des plateformes Franka, JAKA et Feagine. Au-delà de la démonstration sur le robot continuum Feagine A03, les auteurs ne mentionnent aucun pilote industriel ni calendrier de déploiement : il s'agit pour l'instant d'un résultat de recherche accompagné d'une page projet, sans partenariat commercial annoncé.

À lire aussi

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense
1arXiv cs.RO 

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense

Des chercheurs ont publié sur arXiv (référence 2606.11184) TacForeSight, un framework léger d'anticipation tactile guidée par la force pour la manipulation en contact riche. Le système repose sur deux composants : TacForceWM, un modèle du monde tactile qui prédit les dynamiques latentes tactiles à court horizon à partir de capteurs bi-doigts conditionnés par les signaux de force et de couple au poignet à haute fréquence, et une politique conditionnée par l'anticipation tactile (Predictive Tactile-Conditioned Policy) qui exploite ces prédictions comme priors de contact, modélise l'évolution tactile courante-vers-future via cross-attention, et fusionne les features visuo-tactiles via un module de gating adaptatif. Les expériences portent sur cinq tâches représentatives de manipulation sur robot réel et trois scénarios de perturbation en cours de manipulation, avec des résultats supérieurs aux baselines existantes dans tous les cas, notamment sous perturbations de contact dynamiques. Le code et les datasets seront mis à disposition publiquement sur tacforesight.github.io. L'apport technique central est de modéliser explicitement les rôles asymétriques de la force globale au poignet (basse résolution spatiale, haute fréquence) et du toucher local bi-doigts (haute résolution spatiale, dynamique plus lente), distinction que la plupart des méthodes d'imitation learning actuelles ignorent. En opérant entièrement dans un espace latent compact, le framework permet un raisonnement de contact proactif compatible avec le contrôle haute fréquence, là où les approches réactives échouent sous perturbations imprévues. Pour les intégrateurs industriels et les équipes travaillant sur l'assemblage ou le conditionnement robotisé, c'est une démonstration concrète que la fusion force+tactile dans un world model améliore la robustesse réelle sans alourdir l'inférence en temps réel. Ce travail s'inscrit dans une vague de recherche combinant world models et retour tactile pour la manipulation dextre, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur GR00T N2 de NVIDIA qui intègrent également des politiques tactile-aware. Aucun concurrent français ou européen direct n'est identifié sur ce créneau précis, bien que des acteurs comme Pollen Robotics ou Enchanted Tools s'appuient aussi sur la manipulation fine. Il s'agit ici d'un preprint non encore évalué par les pairs, sans déploiement industriel ni partenaire annoncé : les résultats, bien que prometteurs sur cinq tâches de laboratoire, devront être reproduits sur des géométries et conditions de contact plus variées avant de valider la généralisation à l'échelle industrielle.

UEImpact indirect : le code open-source prévu sur tacforesight.github.io pourrait être exploité par des équipes européennes travaillant sur la manipulation fine, comme Pollen Robotics ou les labos CEA-List, mais aucun acteur FR/EU n'est impliqué dans ce travail.

RecherchePaper
1 source
DynaWM : un modèle du monde guidé par un VLA de base pour la manipulation d'objets en mouvement
2arXiv cs.RO 

DynaWM : un modèle du monde guidé par un VLA de base pour la manipulation d'objets en mouvement

DynaWM, un nouveau modèle du monde ("world foundation model") piloté par des architectures vision-langage-action (VLA), vient d'être présenté dans un preprint publié sur arXiv début juillet 2026. Le système cible un point faible connu des modèles VLA actuels : la manipulation d'objets en mouvement. Techniquement, DynaWM combine trois briques, un encodeur d'actions basé sur Mamba-3 qui traite les séquences d'actions produites par le modèle VLA de base, un encodeur visuel V-JEPA 2.1 qui exploite l'historique d'observations multi-vues, et un encodeur d'état proprioceptif du bras robotique, le tout conditionnant un transformeur à diffusion par flow-matching qui régénère des trajectoires d'action adaptées au mouvement de l'objet. Les auteurs ont aussi construit deux jeux de données : le benchmark DynaGrasp-32, qui couvre six catégories de tâches (variation de vitesse, de trajectoire, manipulation multi-objets), et DynaGrasp-1600, soit 32 scénarios, 1 600 démonstrations et environ 1,53 million d'images. Sur des checkpoints VLA finement réglés, DynaWM améliore les taux de réussite de 7,19 à 45,31 points de pourcentage selon le modèle de base (SmolVLA, X-VLA, Pi-0, Pi-0.5) ; sur des checkpoints seulement grossièrement réglés, les gains grimpent à 26 voire 44 points. L'enjeu dépasse la simple performance chiffrée : la plupart des modèles du monde existants sont fine-tunés directement dans l'architecture VLA, ce qui dégrade souvent les capacités du modèle pré-entraîné. En gardant le VLA de base intact et en ajoutant un module de guidage séparé, DynaWM évite ce compromis, un argument qui parle directement aux équipes de recherche en robotique confrontées à la fragilité des VLA lors du fine-tuning. Pour les intégrateurs, cela touche un cas d'usage concret : le tri ou la préhension d'objets sur convoyeur, en environnement non statique, un scénario encore largement absent des démonstrations spectaculaires de préhension immobile. Le travail s'inscrit dans la lignée des modèles VLA généralistes comme Pi-0, Pi-0.5, SmolVLA ou X-VLA, utilisés ici comme bases de comparaison, ainsi que des travaux sur les modèles du monde en robotique et sur l'encodeur visuel auto-supervisé V-JEPA de Meta. À ce stade, il s'agit d'un résultat de recherche académique évalué sur benchmark simulé et jeu de données maison, sans déploiement industriel annoncé ; la suite logique serait une validation sur bras robotiques réels et une comparaison avec d'autres approches de manipulation dynamique comme GR00T N2 ou Helix.

RechercheActu
1 source
DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes
3arXiv cs.RO 

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes

Des chercheurs présentent DECOWAM (Decoupled Whole-Body World-Action Model), un modèle monde-action conçu pour la manipulation mobile sur robots à pattes équipés d'un bras, décrit dans une prépublication arXiv (2608.20114v1) mise en ligne fin août 2026. Le système part d'un backbone FastWAM adapté et gelé, sur lequel sont entraînés uniquement des adaptateurs résiduels, soit 25,95 millions de paramètres entraînables. L'architecture ajoute un goulot d'étranglement futur équivalent-action distillé à partir d'observations privilégiées, des représentations latentes de la base et du bras séparées de manière adversariale, ainsi qu'un conditionnement par la vitesse de la base pour la prédiction vidéo. Les auteurs introduisent également ARMDOG, un nouveau jeu de données collecté sur robot réel qui synchronise vidéo, état corps entier, actions et instructions en langage naturel. Sur un protocole de rejeu fixe, DECOWAM réduit l'erreur quadratique moyenne de prédiction d'action de 21,7% par rapport à FastWAM. Sur 79 essais en boucle fermée par méthode, il obtient la meilleure coordination corps entier et la meilleure robustesse au déplacement de la base parmi les systèmes comparés, tandis que le taux de complétion des tâches reste comparable au meilleur système de référence, sans amélioration nette sur ce critère précis. L'apport principal tient à la séparation explicite du mouvement propre de la caméra (lié au déplacement de la base) des actions du bras, un problème que les modèles monde-action existants, conçus pour des plateformes à base fixe, ignorent largement. Pour les intégrateurs travaillant sur des robots mobiles à bras (quadrupèdes ou plateformes à roues), cela suggère qu'un modèle de prédiction vidéo pré-entraîné peut être adapté à moindre coût, via peu de paramètres, plutôt que réentraîné intégralement pour gérer un point de vue mobile. Le résultat reste toutefois nuancé: les gains portent sur la coordination et la robustesse mesurées en simulation de rejeu, pas sur un saut de performance en complétion de tâche réelle. Le travail se positionne comme une extension aux plateformes mobiles des modèles monde-action initialement développés pour bras fixes, sans nommer de backbone concurrent autre que FastWAM ni d'entreprise partenaire. Il s'agit d'une contribution académique publiée en prépublication, sans annonce de déploiement commercial ni de calendrier de mise en production; le jeu de données ARMDOG pourrait toutefois servir de futur benchmark pour la manipulation mobile corps entier.

RecherchePaper
1 source
Skel-WAM : un modèle du monde conditionné par le squelette de la main pour le transfert humain-robot
4arXiv cs.RO 

Skel-WAM : un modèle du monde conditionné par le squelette de la main pour le transfert humain-robot

Des chercheurs ont publié le 21 septembre 2026 sur arXiv (référence 2609.21514) Skel-WAM, un « world action model » qui transfère des démonstrations de manipulation filmées sur des humains vers le contrôle de robots, via une interface commune de squelette de main combinant superpositions squelettiques et points-clés 2.5-D. Un Video Expert et un Keypoint Expert apprennent conjointement la dynamique visuelle et squelettique dans une architecture Mixture-of-Transformers, tandis qu'un Action Expert entraîné uniquement sur des données robot traduit ces prédictions en commandes exécutables, sans nécessiter d'étiquettes d'action sur les vidéos humaines. Sur quatre tâches bimanuelles réelles et sept tâches simulées, le système atteint des taux de réussite moyens de 79,86 % et 63,29 %, devançant la meilleure référence de 22,22 et 8,28 points de pourcentage respectivement. Le co-entraînement humain-robot fait passer la réussite réelle sur des variantes de tâches absentes des données d'entraînement robot de 38,89 % à 86,11 %. Ce résultat s'attaque à un goulot d'étranglement bien connu de la robotique manipulatrice : les démonstrations robot par téléopération sont coûteuses et couvrent mal la diversité des situations réelles, alors que la vidéo humaine est abondante mais souffre d'un écart d'incarnation entre corps humain et bras robotique. En montrant qu'un espace squelettique partagé suffit à superviser conjointement des données humaines et robotiques sans étiquette d'action, l'approche offre aux intégrateurs et laboratoires un moyen concret d'étendre la couverture de tâches d'une politique sans multiplier les campagnes de téléopération. Le bond observé sur les tâches inédites à l'entraînement robot, plus de 47 points grâce au cotraining, suggère que la vidéo humaine comble des trous de distribution plutôt que de simplement gonfler le volume de données, un argument concret dans le débat sur le passage à l'échelle des modèles vision-langage-action. Ces travaux s'inscrivent dans une recherche active sur les world models et les architectures vision-langage-action, où l'écart entre démonstrations humaines et robotiques freine l'apprentissage par imitation à grande échelle. Il s'agit d'une publication arXiv récente, sans mention de revue par les pairs à ce stade, évaluée sur un périmètre restreint de laboratoire, ce qui invite à la prudence avant d'extrapoler ces chiffres à un déploiement industriel. L'article ne nomme aucune entreprise ni plateforme robotique commerciale et ne fixe aucun calendrier de transfert vers un produit ; la contribution reste pour l'instant méthodologique, mais elle rejoint un corpus croissant de travaux cherchant à exploiter la vidéo humaine comme source de données complémentaire pour entraîner des robots manipulateurs généralistes.

RecherchePaper
1 source