Aller au contenu principal
Modélisation unifiée des actions dans un monde 4D à partir de vidéos avec débruitage asynchrone
RecherchearXiv cs.RO 

Modélisation unifiée des actions dans un monde 4D à partir de vidéos avec débruitage asynchrone

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche dépose sur arXiv (référence 2604.26694) X-WAM, un modèle de monde 4D unifié capable d'exécuter des actions robotiques en temps réel tout en générant simultanément des reconstructions vidéo haute fidélité et des cartes 3D de l'environnement futur. Contrairement à UWM et aux approches antérieures limitées à l'espace 2D en pixels, X-WAM prédit des flux RGB-D multi-caméras : une branche de prédiction de profondeur est greffée sur les derniers blocs d'un Diffusion Transformer vidéo pré-entraîné, une adaptation légère qui capitalise sur des priors visuels existants sans entraînement from scratch. La contribution technique centrale est l'Asynchronous Noise Sampling (ANS) : pendant l'inférence, les actions robotiques sont décodées en quelques étapes de débruitage pour respecter les contraintes de latence temps réel, tandis que la génération vidéo bénéficie du pipeline de débruitage complet. Pré-entraîné sur 5 800 heures de données robotiques, X-WAM atteint 79,2 % de taux de succès moyen sur le benchmark RoboCasa et 90,7 % sur RoboTwin 2.0, surpassant les méthodes existantes sur les métriques visuelles et géométriques de reconstruction.

Le compromis non résolu entre richesse de modélisation du monde et latence d'exécution est le noeud central de ce travail. Les architectures VLA actuelles, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, génèrent des actions rapidement mais n'estiment pas la géométrie 3D de l'environnement ; à l'inverse, les modèles génératifs produisent des représentations spatiales riches mais peinent à décoder à la cadence exigée par le contrôle robotique temps réel. ANS prétend supprimer ce dilemme en allouant des budgets de débruitage asymétriques entre les deux sorties à l'inférence, tout en maintenant un alignement de distribution pendant l'entraînement pour éviter l'écart train/test. Si ces résultats tiennent en conditions réelles, ce design ouvrirait une voie architecturale directe pour la manipulation complexe en espace non structuré.

X-WAM s'inscrit dans la vague de travaux visant à unifier perception, modélisation du monde et contrôle dans un seul réseau neuronal, une direction portée par Genie 2 de DeepMind, UniSim de Google et les recherches de World Labs. Le recours aux priors d'un modèle de diffusion vidéo pré-entraîné pour le grounding spatial est une stratégie partagée par plusieurs travaux récents sur le sim-to-real et les VLA de prochaine génération. Cela dit, l'article reste une prépublication arXiv sans revue par les pairs, et les benchmarks RoboCasa et RoboTwin 2.0 sont entièrement simulés : aucun déploiement sur robot physique n'est documenté. La validation sim-to-real constituera l'épreuve décisive, un écart qui a historiquement fait trébucher des systèmes très performants en environnement virtuel.

À lire aussi

Modélisation unifiée du monde par actions visuelles masquées
1arXiv cs.RO 

Modélisation unifiée du monde par actions visuelles masquées

Des chercheurs présentent Masked Visual Actions, une nouvelle interface de contrôle en espace pixel pour les modèles de monde robotiques, décrite dans un article déposé sur arXiv (2607.19343v1). La méthode consiste à exprimer une action sous forme de trajectoire partiellement révélée d'une entité arbitraire dans une vidéo. Concrètement, révéler le mouvement du robot transforme le modèle en modèle de dynamique directe, capable de prédire comment la scène va réagir à une commande motrice bas niveau. À l'inverse, révéler le mouvement souhaité d'un objet permet au même modèle de retrouver le comportement robotique nécessaire pour produire ce résultat, une forme de modélisation inverse. Le système a été affiné avec seulement 15 heures d'exemples masqués, combinant vidéos réelles et données de simulation. Un unique point de contrôle (checkpoint) obtient une bonne fidélité visuelle et un contrôle fiable sur des scènes variées et plusieurs types d'embodiments robotiques différents. L'intérêt de cette approche pour le secteur tient à l'unification qu'elle propose entre prévision et contrôle au sein d'un seul modèle vidéo, sans représentation d'action spécifique par plateforme. Pour les équipes qui développent des politiques de manipulation, les "rollouts imaginés" produits par le modèle montrent une corrélation avec les résultats d'exécution réelle, ce qui ouvre la voie à évaluer des politiques robotiques sans multiplier les essais physiques coûteux. Le modèle sert aussi d'outil de planification, en classant des futurs candidats pour orienter la prise de décision, et de générateur de trajectoires robotiques à partir d'un mouvement d'objet cible. Avec seulement 15 heures de données de finetuning, ces résultats suggèrent qu'un modèle vidéo pré-entraîné peut absorber l'essentiel des priors physiques nécessaires, réduisant la dépendance à de vastes jeux de données de téléopération spécifiques à chaque robot. Ces travaux s'inscrivent dans la dynamique plus large des modèles de monde vidéo appliqués à la robotique, aux côtés d'approches comme les architectures VLA (vision-langage-action) ou les modèles génératifs de type Genie. La contribution ici porte spécifiquement sur le mode d'expression de l'action en pixels, plutôt que sur une nouvelle architecture réseau. L'article ne précise pas de partenariat industriel ni de déploiement matériel; il s'agit à ce stade d'une démonstration de recherche évaluée en simulation et en environnement contrôlé, dont la généralisation à des déploiements robotiques en production reste à établir.

RecherchePaper
1 source
AHA-WAM : modélisation monde-action asynchrone à horizon adaptatif avec routage de contexte guidé par l'observation
2arXiv cs.RO 

AHA-WAM : modélisation monde-action asynchrone à horizon adaptatif avec routage de contexte guidé par l'observation

Des chercheurs ont publié en juin 2026 AHA-WAM (Asynchronous Horizon-Adaptive World-Action Model), une architecture de contrôle robotique qui dissocie temporellement la prédiction de scène et l'exécution motrice, deux processus jusqu'ici couplés au même rythme dans les modèles monde-action existants. L'architecture repose sur deux Diffusion Transformers (DiT) fonctionnant en parallèle : un DiT "monde" opère à basse fréquence comme planificateur de scène à long horizon, maintenant une mémoire glissante de paires clé-valeur sur les observations passées ; un DiT "action" tourne à haute fréquence en boucle fermée, interrogeant ce contexte latent via une attention jointe par couche. Deux mécanismes complètent le système : un entraînement à décalage adaptatif (horizon-adaptive offset training) et un routage OVCR (Observation-Guided Video-Context Routing), qui permettent à l'expert action d'exploiter le contexte long-horizon sans relancer le DiT vidéo à chaque pas. Sur le benchmark RoboTwin, AHA-WAM atteint 92,80 % de taux de succès moyen ; sur quatre tâches de manipulation en conditions réelles, 78,3 % de succès. La fréquence de contrôle en boucle fermée est de 24,17 Hz, soit un gain de vitesse de 4,59x sur Fast-WAM, sans aucun préentraînement sur données robot. Le résultat principal à retenir pour les intégrateurs et décideurs : un modèle VLA (Vision-Language-Action) peut maintenant planifier à l'échelle de la vidéo long-horizon et agir en temps quasi-réel sans que ces deux branches s'inhibent mutuellement. L'absence de préentraînement robot est notable, car elle suggère que le transfert depuis des données vidéo génériques peut suffire pour atteindre des performances state-of-the-art en manipulation. Le gain de 4,59x en vitesse est cliniquement significatif : 24 Hz permet un contrôle réactif sur bras industriel standard, ce qui rapproche ces architectures d'un déploiement en cellule de production, même si les tâches testées restent des benchmarks de manipulation tabletop, pas des environnements industriels non structurés. AHA-WAM s'inscrit dans la vague des modèles monde-action (world-action models), un paradigme émergent qui injecte des priors physiques dans l'apprentissage de politiques en modélisant conjointement dynamique visuelle et actions. Fast-WAM, cité comme baseline directe, reste la référence de vitesse que ce travail cherche à dépasser. Du côté concurrent, les architectures VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent également sur des transformers multimodaux pour la généralisation en manipulation, mais conservent généralement un pipeline unifié. La prochaine étape logique pour AHA-WAM serait de tester le passage à des environnements semi-structurés et d'évaluer la robustesse du routage OVCR face à des distributions d'observations hors-distribution.

RechercheOpinion
1 source
WorldDiT : une architecture de diffusion unifiée pour la modélisation du monde et des actions
3arXiv cs.RO 

WorldDiT : une architecture de diffusion unifiée pour la modélisation du monde et des actions

WorldDiT est une nouvelle architecture de transformeur à diffusion présentée dans un article arXiv publié fin juillet 2026, qui unifie la génération d'actions robotiques et la modélisation visuelle du monde dans un seul réseau. Contrairement à la tendance dominante consistant à adosser les politiques robotiques à de grands modèles vision-langage (VLM) préentraînés comme backbone, un unique transformeur à diffusion génère ici des séquences d'actions continues tout en prédisant, en parallèle, des patchs RGB normalisés issus des futures images de caméra. Sur les quatre suites de simulation LIBERO, référence standard pour évaluer la généralisation en manipulation robotique, WorldDiT se positionne sur la frontière de Pareto reliant nombre de paramètres et taux de réussite moyen, avec un modèle de moins d'un milliard de paramètres. Ce résultat questionne une hypothèse répandue dans le secteur des politiques vision-langage-action (VLA) : que la performance en manipulation exige de coupler l'action à un VLM massif préentraîné, comme le font des approches telles que Pi-0 ou GR00T N2. Un modèle sub-milliard capable de rivaliser sur ces bancs d'essai ouvre une voie vers des architectures moins gourmandes en calcul, un enjeu concret pour les intégrateurs visant un déploiement embarqué plutôt que du cloud. Le papier s'inscrit dans une lignée de recherches couplant prédiction visuelle et contrôle moteur, alors que le secteur multiplie les architectures VLA à grande échelle (Helix chez Figure, GR00T N2 chez Nvidia). Les auteurs présentent toutefois WorldDiT comme une base de référence pour de futures études de mise à l'échelle, uniquement validée en simulation LIBERO, sans expérimentation sur robot réel à ce stade.

RechercheActu
1 source
FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
4arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source