XGenAct : des modèles d'action du monde enrichis par la géométrie grâce à la génération inter-tâches
Des chercheurs publient sur arXiv (2610.03516) XGenAct, un modèle d'action du monde (WAM, pour world action model) qui prédit l'évolution conjointe des observations et des actions d'un robot. Le système représente cinq types de signaux comme des vidéos RGB, via des codecs déterministes : images RGB, actions du robot, profondeur métrique, normales de surface et segmentation par rôle fonctionnel. Un seul transformeur de diffusion vidéo, entraîné avec un seul objectif, apprend la prédiction temporelle dans tous ces espaces. À l'entraînement, le modèle échantillonne des tâches de perception et d'action, sans têtes spécialisées par modalité. Sur des tâches RLBench non vues à l'entraînement, il atteint 52 % de réussite en boucle fermée dans une comparaison externe à cinq tâches, contre 26 % pour les meilleures références évaluées. Il prédit aussi la profondeur et la segmentation futures plus précisément que les pipelines qui génèrent d'abord du RGB puis appliquent un expert de perception figé.
Pour les équipes qui travaillent sur la manipulation, le résultat va dans le sens d'une hypothèse encore discutée : prédire uniquement des pixels RGB et des actions ne suffit pas à doter un modèle de la compréhension spatiale dont la préhension a besoin. Les approches existantes ajoutent quelques tâches géométriques via des branches ou des têtes dédiées, ce qui fragmente à la fois la supervision et l'architecture. Encoder toute la supervision spatiale dans le même format vidéo simplifie la pile logicielle : pas de décodeur par modalité à maintenir, et un même modèle sert à générer et à percevoir. Le doublement du taux de réussite face aux meilleures références est notable, mais il reste à relativiser. Il provient d'une évaluation en simulation, sur seulement cinq tâches de comparaison externe, et RLBench est un banc d'essai académique qui ne reflète ni le bruit des capteurs ni la variabilité d'un site industriel. Rien dans l'abstract ne dit que le modèle a été testé sur un robot réel, ni quel coût de calcul impose un transformeur de diffusion vidéo à l'inférence, deux points décisifs pour un intégrateur.
Ce travail s'inscrit dans la montée des modèles d'action du monde, qui reprennent les modèles génératifs vidéo pour le contrôle robotique, en concurrence avec les VLA (vision-language-action) classiques de type Pi-0 ou GR00T, qui prédisent directement des actions sans modéliser l'évolution de la scène. La limite de ces WAM, que XGenAct cherche à corriger, est leur supervision centrée sur le RGB. Il s'agit d'une préimpression : elle n'a pas été relue par des pairs et aucun code, jeu de données ni calendrier de déploiement n'est mentionné dans l'abstract. Les prochaines étapes à surveiller sont la validation sur robot physique, la mesure de la latence en boucle fermée et la reproduction des résultats par d'autres laboratoires sur des benchmarks plus variés que RLBench.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




