Aller au contenu principal
IA physiquearXiv cs.RO 

Rolling-WAM : des modèles monde-action avec imagination glissante

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié le 25 septembre 2026 sur arXiv (2609.30247), Rolling-WAM est un "World Action Model" (WAM) pour la manipulation robotique, une architecture couplant génération d'actions et prédiction visuelle du futur. Le problème ciblé : les WAM classiques doivent débruiter entièrement la séquence vidéo-action conjointe à chaque cycle de replanification, ce qui crée une latence pénalisante pour le contrôle en boucle fermée. La méthode répartit ce calcul via une fenêtre glissante de segments vidéo-action à niveaux de bruit échelonnés, débruitant totalement le segment d'action imminent tout en affinant partiellement les segments futurs, qui poursuivent leur traitement au fil des nouvelles images caméra. Évalué sur les bancs d'essai LIBERO et RoboTwin ainsi que sur un humanoïde réel Unitree G1, Rolling-WAM conserve des performances de manipulation comparables aux WAM standards tout en accélérant la replanification en régime stationnaire d'un facteur 4,5.

Ce gain de vitesse s'attaque à un frein connu des modèles génératifs pour le contrôle robotique temps réel : les politiques par diffusion, de plus en plus utilisées dans les modèles de monde et les architectures vision-langage-action, produisent des prédictions réalistes mais coûteuses à chaque étape de replanification, ce qui pousse souvent à réduire leur fréquence ou à alléger les modèles au détriment de la robustesse. En démontrant qu'une accélération de 4,5 fois est atteignable sans modèle plus léger ni perte de performance, Rolling-WAM offre une piste concrète pour rapprocher les WAM d'un usage en conditions réelles, un enjeu suivi de près par les équipes travaillant sur l'autonomie des humanoïdes et des bras manipulateurs industriels.

Les World Action Models forment une famille récente de modèles visant à doter les robots d'une anticipation visuelle avant l'action plutôt qu'une politique purement réactive ; leur principal défaut, le coût du débruitage conjoint à chaque cycle, freine leur usage dans des boucles de contrôle rapides. Rolling-WAM reste à ce stade une contribution de recherche publiée en prépublication arXiv, sans acteur industriel ni produit commercial associé, validée sur des bancs d'essai académiques standards et une seule plateforme matérielle, l'humanoïde Unitree G1. Les auteurs ne communiquent aucun calendrier de transfert vers un système de production, ce qui en fait pour l'instant une preuve de concept technique plutôt qu'une solution prête à déployer.

À lire aussi

L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde
1arXiv cs.RO 

L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde

La modélisation prédictive de l'action robotique franchit une étape avec LAWA, une architecture présentée dans un article publié sur arXiv fin août 2026 sous la référence 2608.24882. Les modèles dits "world action models" (WAM) améliorent le contrôle des robots en simulant l'évolution future des observations visuelles, mais cette génération d'images futures coûte cher en latence au moment de l'exécution. Une variante rapide, Fast-WAM, supprime cette étape pour gagner en vitesse, au prix d'une généralisation nettement plus faible, en particulier lorsque les démonstrations robotiques sont rares ou dans des scénarios hors distribution. LAWA propose un compromis: au lieu de générer des vidéos futures complètes, il encode l'intention future sous forme d'actions latentes compactes, produites par un tokenizer discret pré-entraîné sans action, qui génère des cibles de codebook centrées sur la manipulation. Le modèle débruite conjointement un état latent continu ancré sur ces cibles avec des blocs d'actions exécutables, tout en omettant la branche vidéo future à l'inférence. Sur le benchmark RoboCasa, LAWA atteint des taux de succès moyens de 65,6% en few-shot et 80,8% en données complètes, dépassant Fast-WAM de 9,6 et 4,5 points respectivement, tout en réduisant la latence d'inférence de 42,9% par rapport à la variante Joint-WAM de référence. Ces résultats remettent en question l'idée reçue selon laquelle il faudrait sacrifier l'imagination du futur pour gagner en rapidité d'exécution. Pour les équipes qui développent des politiques de contrôle basées sur des modèles VLA (vision-language-action), le message est clair: la vitesse et la généralisation ne sont pas nécessairement antagonistes si l'information future est compressée intelligemment plutôt que supprimée. C'est un enjeu concret pour l'industrialisation des robots manipulateurs, où le temps de cycle et la robustesse hors distribution conditionnent directement la viabilité en usine ou en entrepôt. Un modèle capable de conserver la qualité de généralisation d'un WAM complet tout en réduisant drastiquement la latence rapproche ces architectures d'un déploiement temps réel réaliste, plutôt que d'un simple exercice de recherche en laboratoire. Le travail s'inscrit dans la lignée des architectures WAM et de leurs déclinaisons rapides, dont Fast-WAM sert ici de point de comparaison direct sur des implémentations appariées. Les auteurs testent aussi LAWA en zero-shot sur LIBERO-Plus, où il affiche une robustesse compétitive, ainsi que sur des tâches réelles où il surpasse les approches concurrentes. Le code et les modèles doivent être publiés, ce qui permettra une vérification indépendante des chiffres annoncés, une précaution utile puisque les métriques de succès en manipulation robotique restent souvent sensibles au choix des tâches et des conditions d'évaluation.

IA physiqueActu
1 source
World Pilot : piloter les modèles VLA avec des a priori monde-action
2arXiv cs.RO 

World Pilot : piloter les modèles VLA avec des a priori monde-action

Une équipe de chercheurs a publié World Pilot (arXiv:2606.12403, juin 2026), un framework conçu pour combler une lacune structurelle des modèles Vision-Language-Action (VLA). Ces modèles, comme Pi-0 de Physical Intelligence ou RT-2 de Google Robotics, tirent leur force d'un préentraînement sur de vastes corpus image-texte, mais ce préentraînement s'appuie sur des paires statiques, alors que la manipulation robotique est un processus continu et riche en contacts dont la dynamique leur échappe. World Pilot introduit un World-Action Model (WAM) qui injecte deux types de priors dans la chaîne de décision : le Latent Steering conditionne la couche de perception sur un latent d'évolution de scène, et l'Action Steering fournit une trajectoire anticipée comme prior de mouvement au générateur d'actions. Sur le benchmark LIBERO-Plus en configuration zero-shot out-of-distribution (OOD), le système atteint 84,7 % de taux de succès global et affiche les meilleurs résultats sur quatre tâches de manipulation en environnement réel, avec des marges significatives lors de variations de point de vue, de géométrie d'objets, d'état déformable et de pose. L'intérêt principal de cette approche est de renforcer la robustesse des VLA face aux écarts de distribution sans réentraînement massif. Fait notable : le prior d'évolution de scène reste efficace même lorsqu'il provient d'un world model préentraîné sur vidéo uniquement, sans post-entraînement sur des données d'action, ce qui rend l'augmentation de VLA existants nettement plus accessible. Pour les équipes de déploiement industriel, cela signifie potentiellement moins de données de fine-tuning pour adapter un modèle à un contexte visuel inédit. Le benchmark zero-shot OOD reste l'un des indicateurs les plus exigeants du domaine, là où la majorité des politiques robotiques s'effondrent dès qu'elles sortent de leur distribution d'entraînement. World Pilot s'inscrit dans un courant actif qui vise à doter les politiques robotiques d'un modèle interne du monde, une direction explorée par DeepMind avec DreamerV3 et par Meta via l'architecture JEPA de Yann LeCun. Les VLA ont démontré des capacités de généralisation sémantique prometteuses, mais leur fragilité face aux variations physiques de l'environnement constituait un frein structurel au déploiement industriel. La question ouverte est de savoir si les marges observées sur LIBERO-Plus se maintiendront sur des benchmarks plus larges comme Open-X-Embodiment et sur des plateformes commerciales telles que les bras Franka Robotics ou Universal Robots, étapes nécessaires pour valider la portée industrielle de l'approche.

UESi les résultats se confirment sur Franka Robotics (allemand) et Universal Robots (danois), plateformes dominantes en Europe, cette approche pourrait réduire le coût d'adaptation des VLA aux lignes industrielles européennes sans données d'action supplémentaires.

💬 Le résultat qui compte vraiment, c'est pas les 84% sur le benchmark, c'est que le prior de scène fonctionne avec un world model entraîné sur vidéo uniquement, zéro donnée d'action. Ça veut dire qu'on peut augmenter un Pi-0 ou un RT-2 sans repartir en fine-tuning robotique de zéro, ce qui était le vrai blocage jusqu'ici. Reste à voir si ça tient sur un Franka en prod, mais c'est le genre de papier qu'on garde sous le coude.

IA physiqueOpinion
1 source
Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde
3arXiv cs.RO 

Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde

Des chercheurs présentent sur arXiv (2605.06222) une méthode d'exécution adaptative pour les World Action Models (WAMs), une famille d'architectures de manipulation robotique qui prédisent simultanément les observations visuelles futures et les séquences d'actions à exécuter. Le problème structurel de ces systèmes est qu'ils exécutent un nombre fixe d'actions prédites après chaque inférence, sans vérifier si le déroulé physique réel correspond à l'état "imaginé" par le modèle. Pour y remédier, les auteurs proposent FFDC (Future Forward Dynamics Causal Attention), un vérificateur léger qui croise en temps réel les actions prédites, la dynamique visuelle anticipée, les observations caméra actuelles et les instructions en langage naturel, pour décider si le plan reste valide ou s'il faut déclencher une nouvelle inférence plus tôt. Ce module est couplé à une stratégie d'entraînement baptisée Mixture-of-Horizon Training, conçue pour améliorer la couverture des trajectoires longues. Sur le benchmark RoboTwin, FFDC réduit le nombre de passes avant du modèle de 69,10 % et le temps d'exécution de 34,02 %, avec un taux de succès en hausse de 2,54 % par rapport à une baseline à chunk court. En conditions réelles, le gain atteint 35 % de succès supplémentaire, bien que le nombre d'essais et les tâches testées ne soient pas précisés dans ce préprint. L'apport principal est de résoudre un compromis structurel qui freine le déploiement industriel des robots manipulateurs : réinférer fréquemment est réactif mais coûteux en calcul, tandis qu'exécuter de longues séquences prédites est efficace mais aveugle aux imprévus. FFDC introduit une troisième voie, où la taille du chunk d'action devient une variable émergente pilotée par la cohérence entre imagination et réalité. Ce mécanisme est particulièrement critique pour les phases de contact riche, où un décalage millimétrique entre état prédit et état réel suffit à faire échouer une saisie, et représente une avancée concrète vers des WAMs opérationnels hors environnement contrôlé. Les WAMs s'inscrivent dans la dynamique plus large des modèles d'actions visuelles et langagières (VLAs), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou RT-2 et ses successeurs chez Google DeepMind. Leur spécificité est d'intégrer explicitement une prédiction de l'état visuel futur pour planifier à plus long horizon. Ce préprint, sans affiliation industrielle déclarée, n'est pas encore évalué par les pairs. La prochaine étape naturelle serait une validation sur des benchmarks standardisés plus larges et des pilotes en environnement industriel non structuré.

IA physiqueOpinion
1 source
WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action
4arXiv cs.RO 

WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action

Un article publié le 3 septembre 2026 sur arXiv (2609.03681) présente WISE, une méthode de post-entraînement pour les modèles VLA (Vision-Language-Action) en robotique manipulatrice. Plutôt que d'affiner ces politiques par démonstrations d'experts coûteuses ou par renforcement en conditions réelles, risqué et onéreux, WISE s'appuie sur un modèle du monde pour imaginer et évaluer des comportements candidats, mais seulement aux états jugés critiques pour l'interaction, sur des horizons courts et multi-vues afin de limiter la dérive de prédiction. Testée sur les modèles Pi-0 et Pi-0.5 de Physical Intelligence, la méthode réduit le temps de calcul GPU d'environ 80% par rapport à une imagination exhaustive, tout en améliorant les performances sur un éventail de tâches de manipulation. Des évaluations en conditions réelles confirment des gains de robustesse et de généralisation face à des changements de distribution. Le résultat s'attaque à un frein connu à l'usage des modèles du monde en robotique: leur coût de calcul et l'accumulation d'erreurs sur de longs horizons de simulation en limitaient jusqu'ici l'intérêt pratique face au renforcement réel. En montrant qu'une imagination sélective et bornée conserve l'essentiel du gain de performance pour un cinquième du coût GPU d'une approche complète, WISE offre aux équipes de recherche appliquée un argument économique pour intégrer ces modèles dans leurs pipelines de fine-tuning sans les risques du reinforcement learning physique. Le travail apporte aussi une preuve empirique que des architectures VLA généralistes comme Pi-0 peuvent gagner en robustesse sans démonstrations supplémentaires, un point clé pour les décideurs qui évaluent le passage du laboratoire au déploiement industriel fiable. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles du monde en robotique, dans un paysage où NVIDIA (GR00T N2) ou Figure AI (Helix) explorent aussi des architectures VLA généralistes, mais en ciblant ici spécifiquement l'efficacité du post-entraînement plutôt que la génération de comportements bout-en-bout. La méthode a été validée sur Pi-0 et Pi-0.5, les bases VLA développées par Physical Intelligence. Il s'agit à ce stade d'un article de recherche, sans annonce de produit commercial, de partenariat industriel ni de calendrier de déploiement; la suite attendue serait son intégration dans des pipelines de fine-tuning propriétaires ou sa reproduction indépendante sur d'autres architectures pour confirmer les gains annoncés.

IA physiqueOpinion
1 source