Aller au contenu principal
ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?
RecherchearXiv cs.RO 

ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie ImageWAM sur arXiv le 19 juin 2026 (arXiv:2606.19531), un cadre WAM (World Action Model) qui substitue la génération vidéo par l'édition d'images pour prédire les actions robotiques. L'argument central : les WAMs vidéo génèrent des tokens denses sur plusieurs trames futures, consomment de la capacité sur des détails sans rapport avec l'action, et propagent des erreurs lors des prédictions à longue portée. ImageWAM réoriente des modèles d'édition d'image préentraînés pour modéliser uniquement la transformation visuelle entre état courant et état cible. À l'inférence, le système ne décode pas la frame cible : il conditionne un expert d'action par flow-matching sur les caches KV produits pendant le débruitage de l'image éditée. Résultats mesurés : FLOPs réduits à 1/6 et latence à 1/4 par rapport aux WAMs vidéo, avec des performances supérieures aux baselines VLA standard et aux WAMs concurrents, sur simulateur comme en conditions réelles, sans préentraînement additionnel de la politique.

Pour la communauté robotique, le résultat questionne une hypothèse fondamentale : la génération vidéo serait indispensable pour que le modèle "comprenne" le monde et déduise des actions pertinentes. ImageWAM montre que l'édition d'image constitue un prior mieux calibré, car elle cible les différences visuelles liées à l'action plutôt que la reconstruction temporelle complète d'une séquence. Les analyses d'attention confirment que les caches se focalisent sur les régions de changement pertinentes pour la tâche, pas sur le fond statique. Pour un intégrateur industriel, l'implication est directe : cycles d'inférence plus rapides et potentiellement matériel embarqué moins coûteux, sans sacrifice de performance selon les expériences rapportées.

Les WAMs s'inscrivent dans la continuité des VLAs (Visual Language Action models), qui combinent perception visuelle, langage naturel et contrôle moteur dans un pipeline unifié. Des modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent sur des représentations visuelles denses pour généraliser les comportements robotiques entre tâches. ImageWAM se positionne comme une alternative frugale, réutilisant des capacités d'édition d'image préentraînées sans nécessiter de préentraînement vidéo de grande échelle. Le papier reste pour l'instant dans le domaine expérimental : aucun déploiement industriel ni partenaire terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes ou de manipulation industrielle, précisément les environnements où la latence d'inférence constitue un critère de qualification déterminant.

À lire aussi

Faster-WAM : les modèles monde-action ont-ils besoin de modules d'action profonds ?
1arXiv cs.RO 

Faster-WAM : les modèles monde-action ont-ils besoin de modules d'action profonds ?

Une équipe de recherche présente Faster-WAM, un nouveau modèle d'architecture pour les World Action Models (WAM), systèmes qui couplent la prédiction d'actions robotiques avec des modèles de monde vidéo. Publié sur arXiv début août 2026, le papier introduit le principe du Dock of Transformer (DoT) : plutôt que de calquer la profondeur du module d'action sur celle du backbone vidéo, comme le font les architectures existantes à backbone partagé ou de type Mixture-of-Transformers, DoT traite le Transformer vidéo pré-entraîné comme un simple hub de représentations et y greffe des têtes de sortie légères via une interface de "docking". Concrètement, Faster-WAM branche une tête d'action d'une seule couche sur un backbone vidéo de 30 couches, l'interface fusionnant les clés et valeurs de toutes les couches vidéo avec un réalignement RoPE. Sans pré-entraînement embodied supplémentaire, le modèle obtient des performances compétitives sur les benchmarks LIBERO et RoboTwin 2.0, une bonne généralisation hors distribution sur LIBERO-Plus, et surtout une latence de bout en bout de 66,5 millisecondes par inférence, soit 3,2 fois plus rapide que Fast-WAM, la référence précédente. Pour l'industrie robotique, l'enjeu est moins la performance brute que la latence exploitable en temps réel : un modèle de contrôle qui prend 200 ms à répondre est difficilement utilisable sur un bras ou un robot mobile évoluant dans un environnement dynamique. En découplant la taille de la tête d'action de la profondeur du backbone vidéo, cette approche laisse entrevoir des VLA (vision-language-action) capables d'exploiter de gros modèles de monde pré-entraînés sans en hériter le coût d'inférence, un compromis que beaucoup d'architectures actuelles peinent à tenir. Le travail s'inscrit dans la tendance de fond des World Action Models, qui cherchent à unifier prédiction vidéo et prédiction d'action dans un même réseau plutôt que d'empiler des modules séparés. À ce stade, les résultats restent cantonnés à des benchmarks de simulation (LIBERO, RoboTwin 2.0) et non à un déploiement sur robot réel : il s'agit d'une contribution architecturale, pas d'un produit commercialisé. Les auteurs ne précisent pas de suite ni de calendrier de transfert vers du matériel physique.

RechercheActu
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
2arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source
XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?
3arXiv cs.RO 

XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?

XEWorld, un banc d'essai contrôle présente par une équipe de recherche, évalué si les modèles du monde conditionnes par l'action, des simulateurs appris pour la manipulation robotique, généralisent a des robots jamais vus pendant l'entrainement. Le protocole isole la variable embodiment en testant des robots non vus dans des scènes physiquement identiques a celles de l'entrainement. Le constat est net: les modèles actuels se comportent avant tout comme des systèmes d'appariement visuel en 2D, dont la généralisation dépend de la similarité visuelle avec les robots déjà vus, et non de la similarité cinématique réelle. Consequence directe, ils peinent a traduire une commande articulaire numérique en trajectoire visuelle cohérente et échouent a prédire une évolution dynamique de la scene a partir d'une simple image statique de départ. Pour rendre correctement un embodiment inédit en zero-shot, il faut leur fournir des actions déjà projetées dans l'espace des pixels et un alignement spatio-temporel explicite, ce qui contourne le problème plutôt que de le résoudre. Meme quand l'adaptation few-shot permet de récupérer l'apparence du nouveau robot, elle declenche un oubli catastrophique des embodiments déjà appris. Ce résultat pèse directement sur l'industrie robotique: les modèles du monde sont promus comme des simulateurs bon marche pour entrainer des politiques VLA telles que Pi-0, GR00T N2 ou Helix, en complément ou en remplacement de la collecte de données réelles et des moteurs physiques classiques. Si ces simulateurs appris ne généralisent pas au-delà des robots vus a l'entrainement, chaque nouvel humanoïde, bras industriel ou plateforme mobile nécessiterait son propre modèle reentraine, ce qui fragilise la promesse d'un simulateur généraliste réutilisable d'un intégrateur a l'autre. L'étude agit aussi comme un correctif face a l'enthousiasme autour des architectures cross-embodiment: la généralisation apparente de certaines démonstrations tiendrait davantage a une ressemblance d'aspect entre robots qu'a une compréhension de la physique sous-jacente, un signal d'alerte pour quiconque évalué des annonces de transfert zero-shot entre plateformes. Cette limite s'inscrit dans une course plus large ou des laboratoires comme Google DeepMind, NVIDIA ou Physical Intelligence développent des modèles du monde et des politiques généralistes censées piloter des robots très différents avec un seul réseau, une démarche destinée a réduire le cout de la collecte de données robot par robot. XEWorld, publie en preprint sur arXiv début aout 2026, ne remet pas en cause l'utilité des modèles du monde en soi mais isole précisément le point de blocage actuel: la confusion entre apparence visuelle et dynamique physique. Les auteurs appellent a des innovations architecturales qui découplent explicitement ces deux dimensions, une piste qui conditionnera la capacité des prochaines générations de simulateurs appris a soutenir un entrainement véritablement cross-embodiment plutôt qu'un simple recyclage visuel de robots déjà connus.

RecherchePaper
1 source
H2R-Bench : évaluation de la génération vidéo de manipulation humain-robot dans les modèles du monde
4arXiv cs.RO 

H2R-Bench : évaluation de la génération vidéo de manipulation humain-robot dans les modèles du monde

Des chercheurs ont publié le 14 août 2026 sur arXiv (2608.13049) un nouveau benchmark baptisé H2R-Bench, conçu pour évaluer la capacité des modèles de génération vidéo à transformer des démonstrations de manipulation humaines filmées à la première personne en vidéos de manipulation robotique correspondant à un embodiment cible. Chaque instance du benchmark associe une vidéo de démonstration humaine, des contraintes d'embodiment robotique, et des annotations ancrées dans la source couvrant les objectifs de tâche, les événements d'action, les contacts fonctionnels et les réactions des objets manipulés. L'évaluation repose sur cinq dimensions : l'atteinte de l'état final visé, la complétude des événements d'action, le transfert des contacts fonctionnels, la cohérence de l'embodiment et la qualité vidéo générale. Les auteurs ont testé onze modèles de génération vidéo de pointe sur six familles de tâches de manipulation et deux embodiments robotiques distincts. Résultat principal : même les modèles les plus performants échouent souvent sur la cohérence d'embodiment, l'interaction fonctionnelle avec les objets et l'exécution correcte de la tâche. Ce constat touche un point sensible de l'apprentissage robotique : la collecte de démonstrations réelles sur robot reste coûteuse et difficile à faire monter en échelle, alors que les vidéos humaines égocentriques sont abondantes et bon marché. Convertir ces vidéos humaines en données d'entraînement robot-centriques via des modèles de monde vidéo est envisagé depuis plusieurs mois comme une voie pour contourner ce goulot d'étranglement, notamment pour entraîner des politiques VLA. H2R-Bench montre que cette promesse reste largement non tenue en pratique : la différence morphologique entre mains humaines et effecteurs robotiques continue de casser la cohérence physique des vidéos générées. Pour les intégrateurs et laboratoires qui envisagent la génération vidéo synthétique comme substitut à la téléopération, ce résultat invite à la prudence sur la maturité réelle de cette approche. Le travail s'inscrit dans la vague plus large des modèles de monde vidéo appliqués à la robotique, où la génération vidéo sert de plus en plus de brique de simulation ou de source de données synthétiques. Jusqu'ici, l'évaluation de ces modèles se limitait souvent à la qualité visuelle brute, sans mesurer si la vidéo générée respecte les contraintes physiques et fonctionnelles d'un robot donné. H2R-Bench comble ce vide avec un cadre diagnostique systématique et réutilisable pour les futurs modèles. Il ne s'agit pas d'une annonce produit ni d'un partenariat industriel, mais d'un travail de recherche évaluative destiné à orienter la prochaine génération de modèles capables de combler l'écart d'embodiment entre humains et robots.

RecherchePaper
1 source