Aller au contenu principal
RecherchearXiv cs.RO 

XGenAct : des modèles d'action du monde enrichis par la géométrie grâce à la génération inter-tâches

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.03516) XGenAct, un modèle d'action du monde (WAM, pour world action model) qui prédit l'évolution conjointe des observations et des actions d'un robot. Le système représente cinq types de signaux comme des vidéos RGB, via des codecs déterministes : images RGB, actions du robot, profondeur métrique, normales de surface et segmentation par rôle fonctionnel. Un seul transformeur de diffusion vidéo, entraîné avec un seul objectif, apprend la prédiction temporelle dans tous ces espaces. À l'entraînement, le modèle échantillonne des tâches de perception et d'action, sans têtes spécialisées par modalité. Sur des tâches RLBench non vues à l'entraînement, il atteint 52 % de réussite en boucle fermée dans une comparaison externe à cinq tâches, contre 26 % pour les meilleures références évaluées. Il prédit aussi la profondeur et la segmentation futures plus précisément que les pipelines qui génèrent d'abord du RGB puis appliquent un expert de perception figé.

Pour les équipes qui travaillent sur la manipulation, le résultat va dans le sens d'une hypothèse encore discutée : prédire uniquement des pixels RGB et des actions ne suffit pas à doter un modèle de la compréhension spatiale dont la préhension a besoin. Les approches existantes ajoutent quelques tâches géométriques via des branches ou des têtes dédiées, ce qui fragmente à la fois la supervision et l'architecture. Encoder toute la supervision spatiale dans le même format vidéo simplifie la pile logicielle : pas de décodeur par modalité à maintenir, et un même modèle sert à générer et à percevoir. Le doublement du taux de réussite face aux meilleures références est notable, mais il reste à relativiser. Il provient d'une évaluation en simulation, sur seulement cinq tâches de comparaison externe, et RLBench est un banc d'essai académique qui ne reflète ni le bruit des capteurs ni la variabilité d'un site industriel. Rien dans l'abstract ne dit que le modèle a été testé sur un robot réel, ni quel coût de calcul impose un transformeur de diffusion vidéo à l'inférence, deux points décisifs pour un intégrateur.

Ce travail s'inscrit dans la montée des modèles d'action du monde, qui reprennent les modèles génératifs vidéo pour le contrôle robotique, en concurrence avec les VLA (vision-language-action) classiques de type Pi-0 ou GR00T, qui prédisent directement des actions sans modéliser l'évolution de la scène. La limite de ces WAM, que XGenAct cherche à corriger, est leur supervision centrée sur le RGB. Il s'agit d'une préimpression : elle n'a pas été relue par des pairs et aucun code, jeu de données ni calendrier de déploiement n'est mentionné dans l'abstract. Les prochaines étapes à surveiller sont la validation sur robot physique, la mesure de la latence en boucle fermée et la reproduction des résultats par d'autres laboratoires sur des benchmarks plus variés que RLBench.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

GEM-4D : modèles du monde vidéo enrichis par la géométrie pour la manipulation robotique
1arXiv cs.RO 

GEM-4D : modèles du monde vidéo enrichis par la géométrie pour la manipulation robotique

Une équipe en soumission anonyme (probablement ICCV ou NeurIPS 2025) publie GEM-4D sur arXiv, un modèle mondial vidéo ancré géométriquement pour la manipulation robotique. Le constat de départ est bien documenté : les VWM (Video World Models) génèrent des séquences futures visuellement plausibles à partir d'une instruction, mais ne maintiennent pas la cohérence du mouvement au niveau des points entre les images, ce qui les rend inutilisables pour l'exécution d'actions physiques fiables. GEM-4D résout cette limitation en injectant, pendant l'entraînement, une supervision de correspondances 4D denses distillée depuis un modèle de fondation géométrique pré-entraîné dans le backbone génératif vidéo, tout en conservant une architecture single-stream sans surcoût à l'inférence. Un module de dynamique inverse convertit ensuite les rollouts vidéo cohérents en trajectoires exécutables, déployables en simulation comme en réel. Sur la combinaison prédiction vidéo et cohérence géométrique, GEM-4D atteint l'état de l'art, et le taux de succès en manipulation réelle progresse de 61 % à 81 %, soit un gain de 20 points. Ce gain de 20 points sur des tâches réelles est le chiffre central : il valide l'hypothèse que la supervision géométrique suffit à combler le gap entre apparence visuelle et ancrage physique. Pour les intégrateurs et décideurs industriels, l'architecture single-stream représente un avantage concret, sans module géométrique séparé à maintenir en opération. Cela positionne les VWM comme une alternative sérieuse aux approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, jusque-là perçues comme plus directement actionnables. La réserve habituelle s'applique : la soumission reste anonyme, les vidéos de la page projet ne permettent pas encore d'évaluation indépendante, et le protocole de test en environnement réel n'est pas détaillé dans le résumé disponible. Les VWM appliqués à la robotique constituent un axe de recherche actif depuis 2023, avec des travaux précurseurs comme UniSim (OpenAI) ou IRASim. GEM-4D s'y distingue en apportant la cohérence géométrique 3D+temporelle qui faisait défaut, en s'appuyant sur des modèles de fondation pour la reconstruction dense, domaine où l'INRIA Paris (à l'origine de DUSt3R et MASt3R) est un acteur européen de référence. La chaîne supervision géométrique → génération vidéo → action robotique apparaît ainsi viable à l'échelle d'un déploiement réel. Les prochaines étapes naturelles seront une validation sur des benchmarks standardisés comme RLBench ou LIBERO, et des tests hors des environnements de laboratoire contrôlés.

UELes modèles géométriques de fondation de l'INRIA Paris (DUSt3R, MASt3R) constituent la base de la supervision géométrique de GEM-4D, positionnant la recherche européenne en reconstruction dense comme un maillon clé de la prochaine génération de modèles de manipulation robotique.

RechercheOpinion
1 source
FOCAL-VLA : distillation géométrique guidée par sous-tâches et modélisation implicite du monde pour les modèles vision-langage-action
2arXiv cs.RO 

FOCAL-VLA : distillation géométrique guidée par sous-tâches et modélisation implicite du monde pour les modèles vision-langage-action

Une équipe de recherche a mis en ligne sur arXiv un nouveau framework baptisé FOCAL-VLA, décrit dans l'article "Subtask-Guided Geometry Distillation and Implicit World Modeling for Vision-Language-Action Models" (arXiv:2609.21228v1, auteur principal Zhiyuan Gao, site du projet zhiyuan-gao.github.io/FOCAL-VLA). La méthode combine deux briques : une distillation géométrique guidée par sous-tâche, qui transfère les connaissances spatiales du modèle VGGT vers le modèle vision-langage-action en alignant ses représentations latentes uniquement sur les zones d'image pertinentes pour l'interaction en cours, et une modélisation implicite du monde, qui capture l'évolution 3D future de la scène via les features de Track4World extraites d'images de démonstration présentes et futures. Point clé technique : ni VGGT ni Track4World ne tournent au moment de l'inférence, seules les représentations apprises pendant l'entraînement guident la génération d'actions. Les auteurs annoncent des performances supérieures aux méthodes de référence à la fois sur des benchmarks de simulation et sur des tâches de manipulation réelle, sans toutefois publier dans l'abstract de chiffres précis (taux de réussite, temps de cycle, charge utile). L'enjeu adressé est connu du secteur : les modèles VLA qui mappent directement une observation 2D vers une action peinent sur la compréhension spatiale et temporelle fine, ce qui limite leur précision sur des manipulations complexes et des séquences longues. Les approches géométriques existantes, en intégrant toute la scène, diluent l'attention du modèle sur des informations non pertinentes pour la tâche en cours. En ciblant la supervision géométrique sur la sous-tâche active et en gardant les modèles auxiliaires hors de la boucle d'inférence, FOCAL-VLA vise un compromis précision-coût de calcul pertinent pour les intégrateurs cherchant à déployer des VLA en production sans surcoût matériel à l'exécution. FOCAL-VLA s'inscrit dans la vague de recherche académique cherchant à enrichir des modèles VLA généralistes (dans la lignée de travaux comme Pi-0, GR00T N2 ou Helix) d'une meilleure compréhension géométrique et temporelle. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, non encore validé par une revue par les pairs ni testé en déploiement commercial ; les résultats comparatifs proviennent des auteurs eux-mêmes et restent à confirmer par des évaluations indépendantes.

RechercheActu
1 source
XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?
3arXiv cs.RO 

XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?

XEWorld, un banc d'essai contrôle présente par une équipe de recherche, évalué si les modèles du monde conditionnes par l'action, des simulateurs appris pour la manipulation robotique, généralisent a des robots jamais vus pendant l'entrainement. Le protocole isole la variable embodiment en testant des robots non vus dans des scènes physiquement identiques a celles de l'entrainement. Le constat est net: les modèles actuels se comportent avant tout comme des systèmes d'appariement visuel en 2D, dont la généralisation dépend de la similarité visuelle avec les robots déjà vus, et non de la similarité cinématique réelle. Consequence directe, ils peinent a traduire une commande articulaire numérique en trajectoire visuelle cohérente et échouent a prédire une évolution dynamique de la scene a partir d'une simple image statique de départ. Pour rendre correctement un embodiment inédit en zero-shot, il faut leur fournir des actions déjà projetées dans l'espace des pixels et un alignement spatio-temporel explicite, ce qui contourne le problème plutôt que de le résoudre. Meme quand l'adaptation few-shot permet de récupérer l'apparence du nouveau robot, elle declenche un oubli catastrophique des embodiments déjà appris. Ce résultat pèse directement sur l'industrie robotique: les modèles du monde sont promus comme des simulateurs bon marche pour entrainer des politiques VLA telles que Pi-0, GR00T N2 ou Helix, en complément ou en remplacement de la collecte de données réelles et des moteurs physiques classiques. Si ces simulateurs appris ne généralisent pas au-delà des robots vus a l'entrainement, chaque nouvel humanoïde, bras industriel ou plateforme mobile nécessiterait son propre modèle reentraine, ce qui fragilise la promesse d'un simulateur généraliste réutilisable d'un intégrateur a l'autre. L'étude agit aussi comme un correctif face a l'enthousiasme autour des architectures cross-embodiment: la généralisation apparente de certaines démonstrations tiendrait davantage a une ressemblance d'aspect entre robots qu'a une compréhension de la physique sous-jacente, un signal d'alerte pour quiconque évalué des annonces de transfert zero-shot entre plateformes. Cette limite s'inscrit dans une course plus large ou des laboratoires comme Google DeepMind, NVIDIA ou Physical Intelligence développent des modèles du monde et des politiques généralistes censées piloter des robots très différents avec un seul réseau, une démarche destinée a réduire le cout de la collecte de données robot par robot. XEWorld, publie en preprint sur arXiv début aout 2026, ne remet pas en cause l'utilité des modèles du monde en soi mais isole précisément le point de blocage actuel: la confusion entre apparence visuelle et dynamique physique. Les auteurs appellent a des innovations architecturales qui découplent explicitement ces deux dimensions, une piste qui conditionnera la capacité des prochaines générations de simulateurs appris a soutenir un entrainement véritablement cross-embodiment plutôt qu'un simple recyclage visuel de robots déjà connus.

RecherchePaper
1 source
EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action
4arXiv cs.RO 

EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action

Des chercheurs proposent EVO-WAM, un cadre d'adaptation de « world action models » (WAM) à des tâches inédites, sans nouvelle démonstration d'expert et sans exécuter les actions candidates dans un environnement externe. Un WAM exploite des priors vidéo à grande échelle pour prédire conjointement les vidéos futures et les actions. Le système repose sur trois briques. D'abord, l'entraînement du WAM est enrichi d'une prédiction d'état et d'un contexte multi-images ancré, ce qui permet des déroulés autorégressifs complets sans retour d'exécution. Ensuite, un modèle vision-langage sélectionne les préfixes de trajectoires où la tâche est accomplie, puis un modèle de dynamique inverse vérifie la cohérence entre vidéo et actions. Enfin, le WAM est réentraîné de façon itérative sur ces préfixes vérifiés, et de nouveaux déroulés sont générés avec le modèle mis à jour. Sur sept tâches inédites de RoboTwin 2.0, le taux de succès moyen de Cosmos3 passe de 26,9 % à 68,0 % (environ 2,5 fois), et celui de DreamZero de 28,5 % à 46,4 % (environ 1,6 fois). Sur trois tâches composites à long horizon en conditions réelles, Cosmos3 passe de 20,0 % à 76,7 %, soit un gain de 56,7 points. L'enjeu porte sur le goulot d'étranglement des démonstrations. Collecter des données d'experts par téléopération reste la principale dépense pour déployer une politique sur une nouvelle tâche. Ici, le modèle génère lui-même sa supervision, filtrée par deux vérificateurs indépendants. Le filtre par dynamique inverse cible un mode d'échec connu des WAM : une vidéo qui semble réussie peut être associée à des actions incompatibles avec elle, ce qui produit un échec à l'exécution. Le résultat suggère que l'auto-amélioration sans interaction avec l'environnement devient praticable pour ces modèles, ce qui réduirait le coût d'adaptation par tâche pour les intégrateurs. Il faut toutefois nuancer. Les gains simulés sont mesurés sur sept tâches. Le test réel ne compte que trois tâches, et le papier ne détaille pas ici le nombre d'essais, ce qui rend l'écart de 56,7 points sensible au bruit statistique. Le point de départ de 20 % en réel est aussi bas. Le papier est un preprint arXiv, non évalué par les pairs, sans déploiement industriel. Ce travail s'inscrit dans la montée des modèles monde et des politiques vision-langage-action (VLA). Ces derniers prédisent des actions directement, tandis que les WAM ajoutent une prédiction vidéo issue de modèles génératifs pré-entraînés. Cosmos3 et DreamZero servent ici de bases, et la méthode s'applique donc à plusieurs architectures. Les approches concurrentes d'amélioration sans démonstration reposent surtout sur l'apprentissage par renforcement en environnement réel ou simulé, plus coûteux en temps robot ou en fidélité de simulation. Le benchmark RoboTwin 2.0, en simulation bimanuelle, sert de référence commune. Les prochaines étapes probables sont des tests sur davantage de tâches réelles, des embodiments variés et des vérificateurs plus fiables, car la qualité du modèle vision-langage et du modèle de dynamique inverse borne ce que la boucle peut apprendre. Une page projet est disponible, mais aucun calendrier de produit n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source