Aller au contenu principal
IA physiquearXiv cs.RO 

Sparse-WAM : accélérer les modèles monde-action grâce à une imagination parcimonieuse guidée par l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Sparse-WAM, un cadre sans entraînement qui accélère l'inférence des « world-action models » (WAMs), ces modèles de contrôle robotique qui s'appuient sur des modèles vidéo pré-entraînés pour prédire conjointement les images futures et les actions. Le coût vient du débruitage : les jetons de frames futures, très nombreux, sont retraités à chaque étape. Sparse-WAM ne traite qu'une partie d'entre eux, sélectionnés d'après leur pertinence pour l'action. Le module Action-Guided Token Selection conserve, pour chaque frame, les régions utiles à l'action, plus un contexte inter-frames. Un moteur nommé Pilot limite le surcoût du calcul des scores d'attention et du regroupement des jetons, grâce à un scoring léger et à la réutilisation des sélections d'une étape à l'autre. Sur LIBERO avec FastWAM-Joint, l'accélération atteint environ 2,0x par rapport à l'inférence dense « eager ». Sur RoboLab-120 avec Cosmos 3 Edge, elle atteint environ 1,8x. Les mesures ont été faites sur une NVIDIA RTX 4090, et les auteurs indiquent que la performance des tâches est « largement préservée ». Le papier (arXiv 2609.38984v1) ne donne pas, dans son résumé, l'ampleur exacte de la perte résiduelle.

Les WAMs promettent une meilleure généralisation que les politiques VLA classiques, mais leur latence est un obstacle au déploiement : un modèle vidéo de grande taille qui « imagine » le futur à chaque cycle de contrôle est difficile à tenir en temps réel sur du matériel embarqué ou abordable. Le travail vise ce point. Une carte grand public comme la RTX 4090 sert ici de référence, ce qui intéresse les intégrateurs qui n'ont pas de grappe de GPU de datacenter. Le gain est modeste (un facteur 2 au mieux) et ne règle pas à lui seul la fréquence de contrôle : la comparaison porte sur une base dense non optimisée, et non sur des moteurs d'inférence déjà très optimisés. Les benchmarks restent de la simulation ou des suites standardisées, sans validation sur robot réel annoncée. L'observation de fond est utile : l'attention des jetons d'action vers les frames futures se recouvre fortement d'un pas de débruitage à l'autre, alors que les représentations continuent d'évoluer. Cela suggère qu'une bonne part de l'« imagination » visuelle est redondante pour décider de l'action.

Ce travail s'inscrit dans la course à l'efficacité des modèles de diffusion vidéo, où l'élagage de jetons visait jusqu'ici la fidélité visuelle plutôt que la pertinence pour l'action. Il prolonge la lignée des politiques VLA et des modèles de monde, avec des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T, Cosmos) ou Figure (Helix), qui cherchent tous à concilier généralisation et latence. Aucun déploiement industriel n'est annoncé. La suite logique est de tester la méthode sur robot réel, de la combiner avec la quantification ou la distillation, et de vérifier qu'elle tient sur des tâches longues et des scènes moins contrôlées. Cette publication est un préprint, non évalué par des pairs.

À lire aussi

C³ache : accélérer les modèles monde-action par cache de blocs inter-inférences
1arXiv cs.RO 

C³ache : accélérer les modèles monde-action par cache de blocs inter-inférences

Des chercheurs ont publié sur arXiv en juin 2026 (référence 2606.08962) une méthode d'accélération appelée C³ache (Cross Inference Chunk Cache), ciblant les World Action Models (WAM), une classe de modèles robotiques qui génèrent des politiques d'action en modélisant la vidéo plutôt qu'en s'appuyant uniquement sur des démonstrations étiquetées. Contrairement aux politiques VLA (Vision-Language-Action) classiques, les WAM s'entraînent sur de la vidéo non labellisée abondante, ce qui améliore leur généralisation à de nouveaux mouvements et environnements, mais au prix d'un coût d'inférence élevé. Pour exécuter une tâche, un WAM enchaîne plusieurs blocs d'inférence successifs (chunks), chacun nécessitant un processus de débruitage coûteux. Les méthodes existantes réduisent ce coût en mettant en cache les calculs au sein d'un même chunk, mais ignorent une source de redondance plus large : la forte corrélation entre les résidus calculés à un même step de débruitage, d'un chunk au suivant, lorsque le robot exécute un comportement fluide. C³ache exploite cette corrélation en réutilisant ces résidus entre chunks consécutifs, sans aucun réentraînement du modèle. Les expériences sur benchmarks avec un backbone Fast-WAM montrent un gain allant jusqu'à 2,5× sur le temps d'inférence total mesuré en wall-clock, avec une dégradation négligeable du taux de succès aux tâches. Ce résultat a une portée concrète pour les équipes cherchant à déployer des robots autonomes à coût raisonnable. Le principal frein à l'adoption industrielle des WAM n'est pas la qualité des politiques générées, mais leur latence d'inférence : réduire ce coût par 2,5× sans modifier les poids du modèle constitue un levier de déploiement immédiat, sans pipeline de réentraînement ni risque de régression. La méthode valide aussi une hypothèse structurelle utile : les trajectoires robotiques lisses produisent des représentations internes stables d'un pas à l'autre, ce qui ouvre la voie à des stratégies de cache plus agressives au niveau système. Pour les intégrateurs et les équipes MLOps, C³ache se présente comme un composant directement intégrable à tout modèle WAM existant. Les WAM s'inscrivent dans une tendance initiée par des modèles comme pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui exploitent tous deux un objectif de génération vidéo pour apprendre à partir de données non étiquetées. La course à la réduction des coûts d'inférence pour ces architectures est intense : Google, Physical Intelligence et plusieurs laboratoires académiques explorent en parallèle la distillation, la quantification et le cache intra-chunk. C³ache se positionne comme une solution orthogonale et combinable avec ces approches. Les auteurs soulignent toutefois une limite importante : la corrélation inter-chunks supposée ne tient que pour des comportements robotiques fluides, et des mouvements brusques ou des transitions rapides pourraient dégrader les performances. Il s'agit pour l'instant d'un preprint non relu par les pairs, et les évaluations restent confinées à des benchmarks simulés ; les prochaines étapes naturelles incluent la validation sur robots physiques et l'intégration dans des pipelines embarqués à contraintes de latence strictes.

IA physiqueActu
1 source
WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action
2arXiv cs.RO 

WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action

Un article publié le 3 septembre 2026 sur arXiv (2609.03681) présente WISE, une méthode de post-entraînement pour les modèles VLA (Vision-Language-Action) en robotique manipulatrice. Plutôt que d'affiner ces politiques par démonstrations d'experts coûteuses ou par renforcement en conditions réelles, risqué et onéreux, WISE s'appuie sur un modèle du monde pour imaginer et évaluer des comportements candidats, mais seulement aux états jugés critiques pour l'interaction, sur des horizons courts et multi-vues afin de limiter la dérive de prédiction. Testée sur les modèles Pi-0 et Pi-0.5 de Physical Intelligence, la méthode réduit le temps de calcul GPU d'environ 80% par rapport à une imagination exhaustive, tout en améliorant les performances sur un éventail de tâches de manipulation. Des évaluations en conditions réelles confirment des gains de robustesse et de généralisation face à des changements de distribution. Le résultat s'attaque à un frein connu à l'usage des modèles du monde en robotique: leur coût de calcul et l'accumulation d'erreurs sur de longs horizons de simulation en limitaient jusqu'ici l'intérêt pratique face au renforcement réel. En montrant qu'une imagination sélective et bornée conserve l'essentiel du gain de performance pour un cinquième du coût GPU d'une approche complète, WISE offre aux équipes de recherche appliquée un argument économique pour intégrer ces modèles dans leurs pipelines de fine-tuning sans les risques du reinforcement learning physique. Le travail apporte aussi une preuve empirique que des architectures VLA généralistes comme Pi-0 peuvent gagner en robustesse sans démonstrations supplémentaires, un point clé pour les décideurs qui évaluent le passage du laboratoire au déploiement industriel fiable. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles du monde en robotique, dans un paysage où NVIDIA (GR00T N2) ou Figure AI (Helix) explorent aussi des architectures VLA généralistes, mais en ciblant ici spécifiquement l'efficacité du post-entraînement plutôt que la génération de comportements bout-en-bout. La méthode a été validée sur Pi-0 et Pi-0.5, les bases VLA développées par Physical Intelligence. Il s'agit à ce stade d'un article de recherche, sans annonce de produit commercial, de partenariat industriel ni de calendrier de déploiement; la suite attendue serait son intégration dans des pipelines de fine-tuning propriétaires ou sa reproduction indépendante sur d'autres architectures pour confirmer les gains annoncés.

IA physiqueOpinion
1 source
Rolling-WAM : des modèles monde-action avec imagination glissante
3arXiv cs.RO 

Rolling-WAM : des modèles monde-action avec imagination glissante

Publié le 25 septembre 2026 sur arXiv (2609.30247), Rolling-WAM est un "World Action Model" (WAM) pour la manipulation robotique, une architecture couplant génération d'actions et prédiction visuelle du futur. Le problème ciblé : les WAM classiques doivent débruiter entièrement la séquence vidéo-action conjointe à chaque cycle de replanification, ce qui crée une latence pénalisante pour le contrôle en boucle fermée. La méthode répartit ce calcul via une fenêtre glissante de segments vidéo-action à niveaux de bruit échelonnés, débruitant totalement le segment d'action imminent tout en affinant partiellement les segments futurs, qui poursuivent leur traitement au fil des nouvelles images caméra. Évalué sur les bancs d'essai LIBERO et RoboTwin ainsi que sur un humanoïde réel Unitree G1, Rolling-WAM conserve des performances de manipulation comparables aux WAM standards tout en accélérant la replanification en régime stationnaire d'un facteur 4,5. Ce gain de vitesse s'attaque à un frein connu des modèles génératifs pour le contrôle robotique temps réel : les politiques par diffusion, de plus en plus utilisées dans les modèles de monde et les architectures vision-langage-action, produisent des prédictions réalistes mais coûteuses à chaque étape de replanification, ce qui pousse souvent à réduire leur fréquence ou à alléger les modèles au détriment de la robustesse. En démontrant qu'une accélération de 4,5 fois est atteignable sans modèle plus léger ni perte de performance, Rolling-WAM offre une piste concrète pour rapprocher les WAM d'un usage en conditions réelles, un enjeu suivi de près par les équipes travaillant sur l'autonomie des humanoïdes et des bras manipulateurs industriels. Les World Action Models forment une famille récente de modèles visant à doter les robots d'une anticipation visuelle avant l'action plutôt qu'une politique purement réactive ; leur principal défaut, le coût du débruitage conjoint à chaque cycle, freine leur usage dans des boucles de contrôle rapides. Rolling-WAM reste à ce stade une contribution de recherche publiée en prépublication arXiv, sans acteur industriel ni produit commercial associé, validée sur des bancs d'essai académiques standards et une seule plateforme matérielle, l'humanoïde Unitree G1. Les auteurs ne communiquent aucun calendrier de transfert vers un système de production, ce qui en fait pour l'instant une preuve de concept technique plutôt qu'une solution prête à déployer.

IA physiqueActu
1 source
L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde
4arXiv cs.RO 

L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde

La modélisation prédictive de l'action robotique franchit une étape avec LAWA, une architecture présentée dans un article publié sur arXiv fin août 2026 sous la référence 2608.24882. Les modèles dits "world action models" (WAM) améliorent le contrôle des robots en simulant l'évolution future des observations visuelles, mais cette génération d'images futures coûte cher en latence au moment de l'exécution. Une variante rapide, Fast-WAM, supprime cette étape pour gagner en vitesse, au prix d'une généralisation nettement plus faible, en particulier lorsque les démonstrations robotiques sont rares ou dans des scénarios hors distribution. LAWA propose un compromis: au lieu de générer des vidéos futures complètes, il encode l'intention future sous forme d'actions latentes compactes, produites par un tokenizer discret pré-entraîné sans action, qui génère des cibles de codebook centrées sur la manipulation. Le modèle débruite conjointement un état latent continu ancré sur ces cibles avec des blocs d'actions exécutables, tout en omettant la branche vidéo future à l'inférence. Sur le benchmark RoboCasa, LAWA atteint des taux de succès moyens de 65,6% en few-shot et 80,8% en données complètes, dépassant Fast-WAM de 9,6 et 4,5 points respectivement, tout en réduisant la latence d'inférence de 42,9% par rapport à la variante Joint-WAM de référence. Ces résultats remettent en question l'idée reçue selon laquelle il faudrait sacrifier l'imagination du futur pour gagner en rapidité d'exécution. Pour les équipes qui développent des politiques de contrôle basées sur des modèles VLA (vision-language-action), le message est clair: la vitesse et la généralisation ne sont pas nécessairement antagonistes si l'information future est compressée intelligemment plutôt que supprimée. C'est un enjeu concret pour l'industrialisation des robots manipulateurs, où le temps de cycle et la robustesse hors distribution conditionnent directement la viabilité en usine ou en entrepôt. Un modèle capable de conserver la qualité de généralisation d'un WAM complet tout en réduisant drastiquement la latence rapproche ces architectures d'un déploiement temps réel réaliste, plutôt que d'un simple exercice de recherche en laboratoire. Le travail s'inscrit dans la lignée des architectures WAM et de leurs déclinaisons rapides, dont Fast-WAM sert ici de point de comparaison direct sur des implémentations appariées. Les auteurs testent aussi LAWA en zero-shot sur LIBERO-Plus, où il affiche une robustesse compétitive, ainsi que sur des tâches réelles où il surpasse les approches concurrentes. Le code et les modèles doivent être publiés, ce qui permettra une vérification indépendante des chiffres annoncés, une précaution utile puisque les métriques de succès en manipulation robotique restent souvent sensibles au choix des tâches et des conditions d'évaluation.

IA physiqueActu
1 source