Aller au contenu principal
RecherchearXiv cs.RO 

WorldDiT : une architecture de diffusion unifiée pour la modélisation du monde et des actions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

WorldDiT est une nouvelle architecture de transformeur à diffusion présentée dans un article arXiv publié fin juillet 2026, qui unifie la génération d'actions robotiques et la modélisation visuelle du monde dans un seul réseau. Contrairement à la tendance dominante consistant à adosser les politiques robotiques à de grands modèles vision-langage (VLM) préentraînés comme backbone, un unique transformeur à diffusion génère ici des séquences d'actions continues tout en prédisant, en parallèle, des patchs RGB normalisés issus des futures images de caméra. Sur les quatre suites de simulation LIBERO, référence standard pour évaluer la généralisation en manipulation robotique, WorldDiT se positionne sur la frontière de Pareto reliant nombre de paramètres et taux de réussite moyen, avec un modèle de moins d'un milliard de paramètres.

Ce résultat questionne une hypothèse répandue dans le secteur des politiques vision-langage-action (VLA) : que la performance en manipulation exige de coupler l'action à un VLM massif préentraîné, comme le font des approches telles que Pi-0 ou GR00T N2. Un modèle sub-milliard capable de rivaliser sur ces bancs d'essai ouvre une voie vers des architectures moins gourmandes en calcul, un enjeu concret pour les intégrateurs visant un déploiement embarqué plutôt que du cloud.

Le papier s'inscrit dans une lignée de recherches couplant prédiction visuelle et contrôle moteur, alors que le secteur multiplie les architectures VLA à grande échelle (Helix chez Figure, GR00T N2 chez Nvidia). Les auteurs présentent toutefois WorldDiT comme une base de référence pour de futures études de mise à l'échelle, uniquement validée en simulation LIBERO, sans expérimentation sur robot réel à ce stade.

À lire aussi

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
1arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source
Modélisation unifiée du monde par actions visuelles masquées
2arXiv cs.RO 

Modélisation unifiée du monde par actions visuelles masquées

Des chercheurs présentent Masked Visual Actions, une nouvelle interface de contrôle en espace pixel pour les modèles de monde robotiques, décrite dans un article déposé sur arXiv (2607.19343v1). La méthode consiste à exprimer une action sous forme de trajectoire partiellement révélée d'une entité arbitraire dans une vidéo. Concrètement, révéler le mouvement du robot transforme le modèle en modèle de dynamique directe, capable de prédire comment la scène va réagir à une commande motrice bas niveau. À l'inverse, révéler le mouvement souhaité d'un objet permet au même modèle de retrouver le comportement robotique nécessaire pour produire ce résultat, une forme de modélisation inverse. Le système a été affiné avec seulement 15 heures d'exemples masqués, combinant vidéos réelles et données de simulation. Un unique point de contrôle (checkpoint) obtient une bonne fidélité visuelle et un contrôle fiable sur des scènes variées et plusieurs types d'embodiments robotiques différents. L'intérêt de cette approche pour le secteur tient à l'unification qu'elle propose entre prévision et contrôle au sein d'un seul modèle vidéo, sans représentation d'action spécifique par plateforme. Pour les équipes qui développent des politiques de manipulation, les "rollouts imaginés" produits par le modèle montrent une corrélation avec les résultats d'exécution réelle, ce qui ouvre la voie à évaluer des politiques robotiques sans multiplier les essais physiques coûteux. Le modèle sert aussi d'outil de planification, en classant des futurs candidats pour orienter la prise de décision, et de générateur de trajectoires robotiques à partir d'un mouvement d'objet cible. Avec seulement 15 heures de données de finetuning, ces résultats suggèrent qu'un modèle vidéo pré-entraîné peut absorber l'essentiel des priors physiques nécessaires, réduisant la dépendance à de vastes jeux de données de téléopération spécifiques à chaque robot. Ces travaux s'inscrivent dans la dynamique plus large des modèles de monde vidéo appliqués à la robotique, aux côtés d'approches comme les architectures VLA (vision-langage-action) ou les modèles génératifs de type Genie. La contribution ici porte spécifiquement sur le mode d'expression de l'action en pixels, plutôt que sur une nouvelle architecture réseau. L'article ne précise pas de partenariat industriel ni de déploiement matériel; il s'agit à ce stade d'une démonstration de recherche évaluée en simulation et en environnement contrôlé, dont la généralisation à des déploiements robotiques en production reste à établir.

RecherchePaper
1 source
WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée
3arXiv cs.RO 

WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée

Des chercheurs ont publié WAM-Nav (Latent World-Action Model for Navigation), un système de navigation visuelle incarnée qui couple la génération d'actions et la prévision visuelle dans un seul modèle, déposé sur arXiv en juin 2026 (réf. 2606.04907). L'architecture repose sur un Diffusion Transformer partagé qui effectue une diffusion jointe asymétrique : il génère simultanément des actions à long horizon et une anticipation visuelle à court horizon, sans recourir aux rollouts autorégressifs multi-étapes qui alourdissent la latence d'inférence. Un mécanisme de conditionnement contextuel à double flux intègre l'historique d'ego-motion à l'échelle de l'épisode et les observations visuelles séquentielles, favorisant des trajectoires lisses et cohérentes. Un module d'alignement d'objectif unifié permet à WAM-Nav de gérer trois modes dans une seule politique : Image-Goal, Point-Goal et exploration libre (No-Goal). Sur les benchmarks ClutterScenes et InternScenes, le système améliore les taux de réussite de 15,7 % en Image-Goal et de 3,3 % en Point-Goal. En déploiement réel, WAM-Nav atteint 85 % de taux de succès moyen sur des environnements intérieurs et extérieurs variés, sans fine-tuning, soit un transfert sim-to-real zéro-shot. Ce résultat intéresse directement les intégrateurs de robotique mobile pour deux raisons concrètes. D'abord, la résolution simultanée de l'action et de l'imagination visuelle dans un seul réseau réduit l'accumulation d'erreurs typique des architectures modulaires, où le prédicteur de scène et le module de politique sont entraînés séparément et se propagent mutuellement leurs erreurs. Ensuite, un taux de 85 % en zéro-shot sur des environnements variés représente un indicateur sérieux, même si les conditions de test (densité d'obstacles, vitesses, types de sols) ne sont pas détaillées dans le résumé et méritent d'être examinées dans le papier complet. Pour un COO ou un décideur B2B, cette architecture suggère des robots de navigation capables de s'adapter à de nouveaux scénarios sans collecte de données coûteuse sur site. Le sim-to-real gap reste l'un des blocages majeurs de la robotique mobile autonome depuis des années : les politiques entraînées en simulation échouent souvent au contact du monde réel en raison des différences de rendu, de dynamique et de bruit des capteurs. WAM-Nav s'inscrit dans une vague de travaux qui combinent modèles de diffusion pour la génération d'actions et représentations latentes du monde, dans la lignée des World Models de type RSSM ou des VLA comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA. Sur le plan concurrentiel, des approches comme NoMaD, ViNT ou les stacks Nav2/ROS 2 restent des références opérationnelles sur AMR commerciaux, et WAM-Nav devra être comparé à ces systèmes dans des conditions contrôlées identiques pour confirmer sa supériorité pratique. L'étape suivante naturelle serait une validation sur des plateformes matérielles réelles en conditions industrielles, dont aucun partenariat ni timeline n'est annoncé à ce stade.

RecherchePaper
1 source
PLUME : modélisation probabiliste unifiée du monde et estimation de paramètres pour la manipulation multi-doigts
4arXiv cs.RO 

PLUME : modélisation probabiliste unifiée du monde et estimation de paramètres pour la manipulation multi-doigts

Une équipe de recherche présente PLUME (Probabilistic Latent Unified World Modeling and Parameter Estimation), une architecture de modèle du monde conçue pour la manipulation dextre avec des mains multi-doigts. L'article, déposé sur arXiv en juin 2026, s'attaque à un obstacle bien documenté en robotique : les politiques entraînées en simulation échouent souvent en déploiement réel parce que des paramètres physiques clés, forme des objets, pose initiale, coefficients de friction, sont inconnus au moment de l'exécution. PLUME apprend conjointement un espace latent représentant plusieurs paramètres physiques hétérogènes et un modèle de dynamique conditionné sur ces paramètres, permettant une inférence en ligne sans ré-entraînement ni fine-tuning. Le système est évalué sur quatre tâches en simulation (vissage de tournevis, rotation de vanne, levage de seau, projection de disque) puis validé sur une tâche de vissage réelle en zéro-shot, surpassant les baselines de référence en apprentissage par renforcement offline et en imitation augmentée par modèle du monde. Ce résultat conteste l'hypothèse que la randomisation de domaine suffit pour les tâches de précision. Visser un tournevis avec une friction faible ou élevée ne demande pas la même stratégie motrice : la politique doit changer qualitativement, pas simplement se robustifier. PLUME répond à cela via une mise à jour bayésienne de la croyance sur les paramètres au fil de l'exécution, fonctionnant comme un système d'adaptation en temps réel sans accès aux vrais paramètres. Le transfert zéro-shot sur hardware est le point fort concret de l'article, même si les conditions exactes du banc d'essai (matériau des objets, tolérances mécaniques de la main utilisée) ne sont pas précisées dans le résumé public, ce qui limite la reproductibilité immédiate. La manipulation dextre multi-doigts reste un problème ouvert depuis plusieurs décennies, avec des tentatives notables chez OpenAI (Dactyl, arrêté en 2021) ou ETH Zurich. PLUME s'inscrit dans une tendance récente couplant modèles du monde et inférence de paramètres, approche complémentaire aux VLA (Vision-Language-Action models) mais plus ciblée sur l'incertitude physique. Les travaux concurrents les plus proches incluent DreamerV3, TD-MPC2 et des méthodes d'inférence contextuelle comme PEARL. La prochaine étape naturelle serait l'extension à des tâches bi-manuelles ou impliquant des objets déformables, domaines où l'incertitude sur les paramètres est encore plus sévère.

RecherchePaper
1 source