Aller au contenu principal
RealtimeWAM : à quelle vitesse peut tourner mon modèle d'action du monde ?
RecherchearXiv cs.RO 

RealtimeWAM : à quelle vitesse peut tourner mon modèle d'action du monde ?

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent RealtimeWAM, un cadre d'inférence qui ne nécessite aucun réentraînement et vise à réduire la latence des World Action Models (WAM), ces modèles qui associent modélisation de la dynamique visuelle et génération d'actions pour piloter un robot. Le travail, publié sur arXiv (2610.10079), part d'un constat : la latence d'inférence des WAM limite la réactivité du contrôle en boucle fermée. Les auteurs combinent l'exécution parallèle, en exploitant les dépendances entre couches pour recouvrir le traitement de l'observation et la prédiction, avec une réutilisation sélective du calcul. Celle-ci consiste à mettre en cache les caractéristiques d'observation dans les zones visuellement stables et à réutiliser les résidus des Transformers, tout en réservant un raffinement supplémentaire aux cas où les ajustements d'action prédits sont faibles. Testé sur FastWAM et OpenWAM, avec les benchmarks RoboTwin, LIBERO et LIBERO-Plus, sur un GPU RTX 4090, le système affiche des latences moyennes de 24,09 ms et 63,09 ms, soit des accélérations moyennes de 8,90 fois et 10,67 fois. Les taux de réussite moyens atteignent 82,75 % et 87,41 %, à 0,02 et 0,53 point de pourcentage de l'inférence native. Sur cinq tâches réelles, le gain de réussite par rapport à l'inférence native est de 17,2 points pour FastWAM et de 37,2 points pour OpenWAM.

L'intérêt tient à la généralité de l'approche. Les WAM sont attractifs parce qu'ils intègrent une représentation de la dynamique du monde à la politique, mais leur coût de calcul les rend difficiles à déployer sur du matériel accessible. Passer à 24 ms sur un GPU grand public de 2022 rend envisageable une fréquence de contrôle compatible avec une boucle fermée, là où la latence native pénalise la réactivité. Le gain en conditions réelles est le résultat le plus parlant : une partie de l'écart entre simulation et terrain semble venir du retard d'inférence plus que de la qualité du modèle, puisque la politique réagit mieux quand elle décide plus vite. À nuancer toutefois : il s'agit d'un preprint non évalué par les pairs, les cinq tâches réelles sont peu nombreuses, les gains les plus forts viennent d'OpenWAM, le plus lent au départ, et les auteurs ne précisent pas dans ce résumé les plateformes robotiques ni le nombre d'essais. Les métriques de latence sont mesurées sur un seul GPU, sans indication sur les plateformes embarquées.

Ce travail s'inscrit dans l'effort d'accélération des WAM. FastWAM a réduit la latence en supprimant la génération explicite de vidéo future au moment du test, mais au prix d'une architecture spécialement conçue. Les stratégies de cache plus générales exploitent la redondance des caractéristiques, sans tenir compte de l'évolution des besoins de calcul en contrôle en boucle fermée. RealtimeWAM se positionne entre les deux, comme couche applicable à diverses architectures, et le fait qu'il améliore FastWAM, déjà optimisé, suggère que les deux approches sont complémentaires. Les prochaines étapes naturelles seraient des tests sur davantage de WAM, sur des GPU embarqués de type Jetson et sur des tâches plus longues et plus variées, ainsi qu'une publication du code permettant de reproduire les résultats.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
1arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source
DeltaWAM : modèles delta monde-action pour la manipulation bimanuelle
2arXiv cs.RO 

DeltaWAM : modèles delta monde-action pour la manipulation bimanuelle

Des chercheurs du AIGeeksGroup publient DeltaWAM (Delta World Action Models), une nouvelle architecture pour piloter des bras robotiques bimanuels via l'apprentissage vidéo, détaillée dans un article arXiv (2609.28811v1) diffusé fin septembre 2026, avec code et démonstrations disponibles sur GitHub. Les modèles World-Action (WAM) classiques transfèrent les connaissances visuelles et de mouvement de générateurs vidéo préentraînés vers le contrôle robotique, mais ils prédisent à chaque étape des images futures complètes, ce qui recalcule inutilement du contenu inchangé et ralentit la génération d'actions en temps réel. DeltaWAM sépare le flux en trois composantes, une ancre dense, un delta visuel épars et un flux d'actions, déclinées en trois architectures selon le partage de calcul et de représentation. Le système ajoute une Streaming Delta Memory (SDM) qui met à jour un contexte d'ancrage en cache à partir des seuls changements observés, évitant de repasser par le lourd module vidéo à chaque pas. Sur le benchmark RoboTwin, DeltaWAM avec SDM porte le taux de réussite moyen de 81,3% à 85,4% en conditions standard, et de 75,8% à 83,9% avec randomisation visuelle, par rapport à la référence Fast-WAM. Les trois architectures réduisent le coût de calcul à l'entraînement de 17,78 à 23,77%, tandis que la SDM abaisse la latence d'inférence de 36,57% et le calcul associé de 31,55%. Pour l'industrie robotique, ce travail cible un goulot d'étranglement concret: les modèles génératifs vidéo, puissants pour transférer des priors de mouvement, restent trop lourds pour du contrôle en quelques pas de temps, un frein direct pour des manipulations bimanuelles réactives en usine ou en logistique. En découplant la dynamique liée à l'action des variations d'apparence parasites, DeltaWAM répond à un doute récurrent sur les architectures VLA à grande échelle: leur capacité à généraliser sans reconstruire l'intégralité de la scène à chaque inférence. Les gains annoncés en conditions réelles restent toutefois évalués par les auteurs eux-mêmes, face à un nombre limité de politiques concurrentes, sans validation indépendante à ce stade. L'article s'inscrit dans la lignée des WAM apparus pour exploiter les générateurs vidéo comme source de priors physiques, avec Fast-WAM comme point de comparaison direct explicitement cité. Aucun acteur industriel ni équipe européenne n'est mentionné, le travail restant à ce stade une contribution académique avec code ouvert, sans annonce de déploiement matériel ni de partenariat commercial.

RechercheActu
1 source
EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action
3arXiv cs.RO 

EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action

Des chercheurs proposent EVO-WAM, un cadre d'adaptation de « world action models » (WAM) à des tâches inédites, sans nouvelle démonstration d'expert et sans exécuter les actions candidates dans un environnement externe. Un WAM exploite des priors vidéo à grande échelle pour prédire conjointement les vidéos futures et les actions. Le système repose sur trois briques. D'abord, l'entraînement du WAM est enrichi d'une prédiction d'état et d'un contexte multi-images ancré, ce qui permet des déroulés autorégressifs complets sans retour d'exécution. Ensuite, un modèle vision-langage sélectionne les préfixes de trajectoires où la tâche est accomplie, puis un modèle de dynamique inverse vérifie la cohérence entre vidéo et actions. Enfin, le WAM est réentraîné de façon itérative sur ces préfixes vérifiés, et de nouveaux déroulés sont générés avec le modèle mis à jour. Sur sept tâches inédites de RoboTwin 2.0, le taux de succès moyen de Cosmos3 passe de 26,9 % à 68,0 % (environ 2,5 fois), et celui de DreamZero de 28,5 % à 46,4 % (environ 1,6 fois). Sur trois tâches composites à long horizon en conditions réelles, Cosmos3 passe de 20,0 % à 76,7 %, soit un gain de 56,7 points. L'enjeu porte sur le goulot d'étranglement des démonstrations. Collecter des données d'experts par téléopération reste la principale dépense pour déployer une politique sur une nouvelle tâche. Ici, le modèle génère lui-même sa supervision, filtrée par deux vérificateurs indépendants. Le filtre par dynamique inverse cible un mode d'échec connu des WAM : une vidéo qui semble réussie peut être associée à des actions incompatibles avec elle, ce qui produit un échec à l'exécution. Le résultat suggère que l'auto-amélioration sans interaction avec l'environnement devient praticable pour ces modèles, ce qui réduirait le coût d'adaptation par tâche pour les intégrateurs. Il faut toutefois nuancer. Les gains simulés sont mesurés sur sept tâches. Le test réel ne compte que trois tâches, et le papier ne détaille pas ici le nombre d'essais, ce qui rend l'écart de 56,7 points sensible au bruit statistique. Le point de départ de 20 % en réel est aussi bas. Le papier est un preprint arXiv, non évalué par les pairs, sans déploiement industriel. Ce travail s'inscrit dans la montée des modèles monde et des politiques vision-langage-action (VLA). Ces derniers prédisent des actions directement, tandis que les WAM ajoutent une prédiction vidéo issue de modèles génératifs pré-entraînés. Cosmos3 et DreamZero servent ici de bases, et la méthode s'applique donc à plusieurs architectures. Les approches concurrentes d'amélioration sans démonstration reposent surtout sur l'apprentissage par renforcement en environnement réel ou simulé, plus coûteux en temps robot ou en fidélité de simulation. Le benchmark RoboTwin 2.0, en simulation bimanuelle, sert de référence commune. Les prochaines étapes probables sont des tests sur davantage de tâches réelles, des embodiments variés et des vérificateurs plus fiables, car la qualité du modèle vision-langage et du modèle de dynamique inverse borne ce que la boucle peut apprendre. Une page projet est disponible, mais aucun calendrier de produit n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
WAMJET : un cadre pour accélérer les modèles d'action du monde
4arXiv cs.RO 

WAMJET : un cadre pour accélérer les modèles d'action du monde

WAMJET, présenté sur arXiv (2610.03797, version 2), est un « harness » agentique qui accélère l'inférence des World Action Models (WAM). Ces modèles réutilisent des modèles de fondation vidéo pré-entraînés pour la manipulation robotique, en prédisant conjointement la vidéo future et les actions. Ce couplage et la taille des backbones rendent l'inférence coûteuse. Le harness dote des agents de code de consignes d'optimisation réutilisables et d'outils de mesure et de validation. L'agent suit un flux piloté par les goulots d'étranglement : il profile l'inférence, modifie le code ciblé, valide les effets, puis affine la pile d'accélération à mesure que les goulots se déplacent, sans dégrader la qualité des actions. Les expériences couvrent six WAM, trois agents de code et deux architectures de GPU. WAMJET atteint jusqu'à 9,95x d'accélération sans perte par rapport aux implémentations amont. Des optimisations par approximation et adaptées au matériel réduisent encore la latence, avec des taux de succès comparables. Ce travail s'attaque à un frein concret du déploiement des WAM : leurs latences d'inférence. Les techniques d'accélération existent déjà (quantification, distillation, réduction du nombre de pas de diffusion, optimisation des noyaux), mais choisir et composer celles qui conviennent à chaque modèle et à chaque plateforme matérielle demande un travail d'ingénierie lourd et répété. En automatisant cette étape avec des agents de code, les auteurs proposent de la traiter comme un problème d'optimisation outillé plutôt que comme du sur-mesure. Pour un intégrateur ou une équipe qui porte un WAM sur un robot réel, le gain de latence conditionne la fréquence de contrôle atteignable. Le résultat suggère aussi que les implémentations amont des WAM laissent beaucoup de performance inexploitée. Le chiffre de 9,95x est un maximum, obtenu sur le meilleur cas, et non une moyenne. L'extrait disponible ne détaille ni les latences absolues ni la liste des six modèles, ce qui limite la lecture de ce chiffre. La mention de taux de succès « comparables » pour les variantes approximatives demande à être vérifiée sur des tâches physiques variées, et pas seulement sur des benchmarks. Cette approche s'inscrit dans deux tendances. La première est la montée des modèles d'action fondés sur la vidéo, qui héritent de la qualité des modèles vidéo génératifs, mais aussi de leur coût de calcul, par opposition aux VLA classiques, plus légers. La seconde est l'usage d'agents de code pour optimiser des systèmes, sur le modèle de l'ingénierie assistée de noyaux GPU. Les travaux concurrents sur l'accélération des VLA, comme les politiques à flow matching ou à diffusion réduite en pas, visent le même objectif de contrôle temps réel, mais sans automatiser la composition des techniques. La suite logique est une validation sur robots physiques et sur davantage de plateformes, notamment embarquées, où les contraintes de calcul sont les plus fortes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source