Aller au contenu principal
OpenWAM : un cadre ouvert pour des modèles monde-action composables
RecherchearXiv cs.RO 

OpenWAM : un cadre ouvert pour des modèles monde-action composables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

OpenWAM est un cadre open source de modèles monde-action (WAM, world-action models), ces systèmes qui couplent la prédiction vidéo du futur au contrôle d'un robot. Les auteurs partent de Wan2.2-5B, un modèle de génération vidéo de 5 milliards de paramètres, qu'ils pré-entraînent de façon causale sur plus de 10 000 heures de vidéo robotique. Ils y greffent un « expert d'action » via une architecture Mixture-of-Transformers partagée. Celle-ci permet quatre modes de génération : conjointe, vidéo puis action, action puis vidéo, et découplée. Sur les quatre suites du benchmark de simulation LIBERO, le système obtient des taux de réussite élevés, de même que sur des tâches bimanuelles réelles dont l'abstract ne détaille ni le nombre ni les conditions. L'adaptation causale conjuguée à l'entraînement sur vidéo robotique fait passer le taux de réussite en mode vidéo puis action sur LIBERO-Long de 68,4 % à 97,8 %.

L'apport principal tient à la méthode plus qu'à un score. Les WAM existants changent simultanément de backbone vidéo, de structure d'interaction, de supervision et de procédure d'inférence, ce qui empêche d'attribuer un gain à un choix de conception précis. OpenWAM fournit un banc d'essai commun où l'on ne modifie qu'un paramètre à la fois. Les résultats sur la dynamique sont les plus intéressants pour les équipes qui cherchent à réduire leur dépendance aux démonstrations coûteuses. Quand seul le prédicteur vidéo est adapté à une nouvelle tâche, un modèle de dynamique inverse gelé, à contexte local, entraîné sur des transitions contrefactuelles et des démonstrations, atteint 84,0 % de réussite moyenne sur quatre tâches LIBERO-90 jamais vues. Le même modèle entraîné sur les seules démonstrations plafonne à 21,5 %, et une version à contexte complet atteint 47,0 %. En dynamique directe, la supervision contrefactuelle réduit l'erreur de prédiction RGB de 34,5 % et fait passer l'identification du bon résultat de 21,1 % à 71,3 % parmi 16 issues partant du même état. Ces chiffres viennent de LIBERO, un benchmark simulé et saturé, et d'un article non encore évalué par des pairs : ils ne disent rien du fossé entre démonstration et déploiement industriel.

Ce travail s'inscrit dans la montée des politiques fondées sur la vidéo, qui font concurrence aux modèles vision-langage-action (VLA) classiques comme Pi-0 ou GR00T. Leur promesse est de tirer parti de la grande quantité de vidéo disponible, au-delà des seules démonstrations réussies. Wan2.2 sert ici de socle, ce qui illustre la réutilisation des modèles vidéo génératifs ouverts en robotique. Le cadre est publié sous le numéro arXiv 2610.07922, en version 1, et l'abstract ne mentionne aucun pilote industriel ni calendrier de déploiement. La suite logique serait une validation sur davantage de tâches réelles, avec des comparaisons à poids de calcul équivalent contre les VLA établis.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

WAMJET : un cadre pour accélérer les modèles d'action du monde

WAMJET, présenté sur arXiv (2610.03797, version 2), est un « harness » agentique qui accélère l'inférence des World Action Models (WAM). Ces modèles réutilisent des modèles de fondation vidéo pré-entraînés pour la manipulation robotique, en prédisant conjointement la vidéo future et les actions. Ce couplage et la taille des backbones rendent l'inférence coûteuse. Le harness dote des agents de code de consignes d'optimisation réutilisables et d'outils de mesure et de validation. L'agent suit un flux piloté par les goulots d'étranglement : il profile l'inférence, modifie le code ciblé, valide les effets, puis affine la pile d'accélération à mesure que les goulots se déplacent, sans dégrader la qualité des actions. Les expériences couvrent six WAM, trois agents de code et deux architectures de GPU. WAMJET atteint jusqu'à 9,95x d'accélération sans perte par rapport aux implémentations amont. Des optimisations par approximation et adaptées au matériel réduisent encore la latence, avec des taux de succès comparables. Ce travail s'attaque à un frein concret du déploiement des WAM : leurs latences d'inférence. Les techniques d'accélération existent déjà (quantification, distillation, réduction du nombre de pas de diffusion, optimisation des noyaux), mais choisir et composer celles qui conviennent à chaque modèle et à chaque plateforme matérielle demande un travail d'ingénierie lourd et répété. En automatisant cette étape avec des agents de code, les auteurs proposent de la traiter comme un problème d'optimisation outillé plutôt que comme du sur-mesure. Pour un intégrateur ou une équipe qui porte un WAM sur un robot réel, le gain de latence conditionne la fréquence de contrôle atteignable. Le résultat suggère aussi que les implémentations amont des WAM laissent beaucoup de performance inexploitée. Le chiffre de 9,95x est un maximum, obtenu sur le meilleur cas, et non une moyenne. L'extrait disponible ne détaille ni les latences absolues ni la liste des six modèles, ce qui limite la lecture de ce chiffre. La mention de taux de succès « comparables » pour les variantes approximatives demande à être vérifiée sur des tâches physiques variées, et pas seulement sur des benchmarks. Cette approche s'inscrit dans deux tendances. La première est la montée des modèles d'action fondés sur la vidéo, qui héritent de la qualité des modèles vidéo génératifs, mais aussi de leur coût de calcul, par opposition aux VLA classiques, plus légers. La seconde est l'usage d'agents de code pour optimiser des systèmes, sur le modèle de l'ingénierie assistée de noyaux GPU. Les travaux concurrents sur l'accélération des VLA, comme les politiques à flow matching ou à diffusion réduite en pas, visent le même objectif de contrôle temps réel, mais sans automatiser la composition des techniques. La suite logique est une validation sur robots physiques et sur davantage de plateformes, notamment embarquées, où les contraintes de calcul sont les plus fortes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action
2arXiv cs.RO 

ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action

Des chercheurs publient ActiveWAM, un modèle unifié « monde-action » (world-action model) destiné à la manipulation à vision active, c'est-à-dire des politiques qui pilotent à la fois les effecteurs et la caméra. Le système génère des actions bimanuelles et des mouvements pan/tilt, y compris des comportements de maintien du point de vue (« stay ») et de réacquisition, à partir d'un historique tenant compte des vues, puis met à jour son contexte avec les nouvelles images RGB mesurées. Il est entraîné par une « inversion au moment de l'entraînement » (training-time inversion), qui contraint un prior vidéo figé par les preuves visuelles de la tâche et les changements temporels visibles. Cela supprime l'inversion au test et le classement de candidats. La prédiction de vidéo future sert de signal de co-entraînement, mais la génération d'actions n'exige ni décodage vidéo futur ni annotation de point de vue optimal. L'équipe introduit aussi RoboTwin-AV, un benchmark de 50 tâches avec contrôle pan/tilt exécutable et démonstrations générées automatiquement. ActiveWAM gagne jusqu'à 17,0 points de pourcentage de réussite hors distribution sur TAVIS face aux meilleures références. Il devance Fast-WAM de 20,0 points sur RoboTwin-AV et de 26,7 points sur des tâches physiques de cuisine en conditions réelles. L'intérêt tient à la manière dont le travail formalise un problème souvent traité de façon empirique. Bouger la caméra pour acquérir une nouvelle vue peut écarter du champ des indices critiques pour la tâche, tandis que conserver la vue perd des observations potentiellement utiles. Poser ce compromis « garder ou acquérir » comme un problème de gestion des preuves, appris conjointement avec la manipulation, évite de recourir à des heuristiques de recherche de vue ou à du classement de candidats coûteux à l'exécution. Le fait que l'action se génère sans décoder la vidéo future réduit aussi la charge de calcul au déploiement, un point sensible pour les intégrateurs. Les gains réels de 26,7 points sont notables, mais ils portent sur des tâches de cuisine dont le nombre et la diversité ne sont pas précisés dans le résumé. Le benchmark étant introduit par les mêmes auteurs, la comparaison reste à confirmer par des évaluations indépendantes. Ce travail s'inscrit dans l'essor des modèles monde-action, qui exploitent des priors vidéo pré-entraînés pour guider le contrôle, avec Fast-WAM comme principale référence ici. La plupart des politiques de manipulation actuelles supposent une caméra fixe ou montée sur la tête, et ne contrôlent pas activement la vue. Le benchmark RoboTwin-AV prolonge l'écosystème RoboTwin en y ajoutant le contrôle de caméra, ce qui pourrait servir de base commune à d'autres équipes. Il s'agit d'une publication de recherche, sans produit, déploiement industriel ni calendrier commercial annoncés. Les prochaines étapes naturelles seraient des tests sur davantage de plateformes, des environnements moins structurés que la cuisine, et une intégration avec les grands modèles VLA du secteur.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
3arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source
RoboCoach : des modèles du monde comme coachs actifs pour les compétences robotiques composables
4arXiv cs.RO 

RoboCoach : des modèles du monde comme coachs actifs pour les compétences robotiques composables

Des chercheurs présentent RoboCoach, un cadre de « coaching » piloté par un modèle du monde, destiné à améliorer des compétences robotiques réutilisables sans multiplier les démonstrations de bout en bout. Le système repose sur CoachWorld, un modèle du monde conditionné par l'action et partagé entre les compétences. Il exécute en imagination des « experts » de compétences (des adaptateurs spécialisés) dans une boucle baptisée RIDI (Route-Imagine-Diagnose-Improve). Un juge de progression consigne la première sous-tâche qui échoue. L'agrégation de ces échecs imaginés détermine quelles démonstrations de sous-tâches collecter et quels adaptateurs mettre à jour. L'évaluation couvre deux suites de simulation et deux plateformes réelles, Franka et AgileX. Avec seulement 150 démonstrations supplémentaires, le taux de succès passe de 13,3 % à 75,0 % sur Franka et de 40,0 % à 83,8 % sur AgileX. Sur 22 paires tâche-politique, le succès imaginé et le succès réel sont corrélés (rho = 0,840). Sur quatre compositions de tâches jamais vues, les experts coachés atteignent 35,0 % de succès en moyenne, contre 0 % pour une politique partagée mise à jour avec des démonstrations collectées uniformément. L'enjeu touche au coût de la donnée, principal goulot d'étranglement de la manipulation à long horizon. Les tâches enchaînent des compétences réutilisées dans de nombreuses combinaisons, et collecter des démonstrations complètes pour chaque variante ne passe pas à l'échelle. Cibler la sous-tâche qui échoue en premier plutôt que d'élargir la collecte à l'aveugle est une réponse pragmatique pour un intégrateur qui doit amortir ses campagnes de téléopération. La corrélation de 0,840 suggère aussi qu'un modèle du monde peut servir de banc d'essai pour prioriser la collecte avant de mobiliser du matériel réel. Deux réserves s'imposent. Il s'agit d'un preprint, et 22 paires constituent un échantillon restreint. Le gain de 35,0 % sur compositions inédites reste modeste en valeur absolue : il prouve un transfert, pas une généralisation robuste. Les 0 % du témoin montrent surtout que la mise à jour uniforme ne transfère pas, ce qui dépend du protocole choisi par les auteurs. Ce travail s'inscrit dans la montée des politiques modulaires et des modèles du monde, face aux approches VLA monolithiques entraînées de bout en bout, qui demandent des volumes de données croissants. Il prolonge les efforts d'auto-amélioration des robots, où le système décide lui-même quoi apprendre ensuite. L'article ne précise ni code ouvert ni calendrier de déploiement industriel : une page projet est annoncée, mais aucune suite commerciale ne l'est. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues, avec davantage de plateformes et de compositions, ainsi que la fiabilité du juge de progression, dont dépend tout le diagnostic. Aucun acteur français ou européen n'est cité dans ces travaux.

RecherchePaper
1 source