Aller au contenu principal
RecherchearXiv cs.RO 

WAM-Cache : réutilisation du cache KV à obsolescence bornée pour des modèles du monde et d'action efficaces

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient WAM-Cache, un cadre d'accélération sans entraînement pour les World Action Models (WAMs). Ces modèles de manipulation généraliste conditionnent un « action expert » sur les représentations d'un Diffusion Transformer (DiT) vidéo préentraîné. En boucle fermée, ce DiT vidéo s'exécute à chaque « chunk » d'actions. Il encode l'observation courante en paires clé-valeur (KV) par couche, que l'action expert interroge ensuite. Ce préremplissage (prefill) domine le coût de calcul par chunk, et les accélérations existantes sans entraînement le laissent entièrement dense. WAM-Cache conserve les représentations KV d'un chunk à l'autre et ne recalcule qu'un sous-ensemble épars de tokens. Sur Fast-WAM, le prefill du DiT vidéo perd 32 à 42 % de FLOPs sur RoboTwin 2.0, LIBERO et en expérimentation réelle. La perte reste de 0,7 à 1,8 point de pourcentage par rapport à la politique dense en simulation, et de 2,5 points sur robot réel. Il s'agit d'un résultat de recherche (preprint arXiv), sans produit ni déploiement industriel associé.

L'enjeu tient à la méthode de sélection autant qu'au gain de calcul. Les auteurs montrent que l'heuristique intuitive, qui rafraîchit les tokens ayant visuellement bougé, plafonne nettement sous la politique dense, même avec un oracle qui prédirait la dérive réelle des KV. La précision des actions dépend de l'endroit où l'action expert porte son attention, pas de ce qui a changé dans l'image. Cela compte pour quiconque cherche à faire tourner des politiques fondées sur la vidéo en temps réel sur du matériel embarqué, où la latence et la consommation limitent le déploiement. Un gain de 32 à 42 % sur la partie dominante du coût est utile, mais il reste modeste et ne fait pas à lui seul passer ces modèles à l'échelle industrielle. Les chiffres portent sur Fast-WAM et sur des benchmarks de simulation, plus une évaluation réelle dont l'ampleur n'est pas précisée dans le résumé. Le coût de 2,5 points en réel est plus élevé qu'en simulation et mérite d'être vérifié sur des tâches plus variées.

WAM-Cache sélectionne l'ensemble de rafraîchissement en combinant la cross-attention de l'action expert et la « surprise latente » visuelle. Une borne stricte d'âge limite l'accumulation d'erreurs : un token ne peut pas rester périmé au-delà d'un seuil. Le travail s'inscrit dans la tendance des WAMs, qui exploitent les priors de dynamique des modèles vidéo pour piloter la manipulation, face aux VLA plus classiques comme Pi-0 ou GR00T. Il prolonge aussi les techniques de cache KV et de réutilisation de calcul connues pour les LLM et les DiT, ici adaptées à un contrôle en boucle fermée. Comme la méthode ne demande aucun réentraînement, elle peut en principe s'appliquer à d'autres WAMs. Cela reste à démontrer, car les résultats publiés ne concernent que Fast-WAM. Aucune date de code ou de publication de modèle n'est mentionnée.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation
1arXiv cs.RO 

DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation

Des chercheurs présentent DiffWAM, un modèle « monde-action » de navigation pour drones (UAV) qui convertit les représentations prédictives d'un modèle vidéo gelé en trajectoires de caméra continues en 3D. Là où les approches courantes génèrent d'abord une vidéo du futur, puis reconstruisent la géométrie pour en tirer un mouvement, DiffWAM s'en dispense au déploiement. Le module Grid-Motion conserve les associations spatio-temporelles du mouvement à partir de caractéristiques multi-niveaux. Le module Latent2Pose les ancre dans la géométrie de la première image pour retrouver un mouvement 3D métriquement cohérent. Les rollouts vidéo complets et la reconstruction géométrique ne servent qu'à la supervision hors ligne. Le système inclut aussi FastDreamer, qui recouvre le calcul prédictif et géométrique avec le vol en cours et transmet les trajectoires de façon asynchrone, avec horodatage, pour une exécution continue. Sur le banc d'essai DiffWAM-1000 (1 000 échantillons), le modèle atteint une RMSE de trajectoire de 0,3492 m et un taux de succès à l'arrivée de 74,40 %. Une version embarquée, DiffWAM-Flash, affiche 1,08 s de latence pour le pipeline du modèle sur NVIDIA Jetson AGX Thor. L'intérêt tient à la latence et au coût de calcul, deux obstacles à l'usage de modèles vidéo de fondation en robotique aérienne. Supprimer le décodage vidéo et la reconstruction multi-images à l'inférence rend ces modèles plus compatibles avec un calcul embarqué. Cela suggère que le mouvement est déjà largement encodé dans les représentations prédictives, sans passer par une vidéo générée. Les résultats appellent toutefois des réserves. Le banc DiffWAM-1000 semble propre aux auteurs, et un succès à l'arrivée de 74,40 % laisse environ un échec sur quatre, ce qui reste loin d'un seuil industriel. Une latence de 1,08 s dit peu de choses sans connaître la vitesse de vol, la fréquence de replanification et la gestion des obstacles dynamiques. Les expériences réelles (passages contraints, orbites, trajectoires en S, navigation multi-étapes) sont qualifiées de représentatives, donc probablement choisies, sans statistiques de réussite publiées dans le résumé. Ce travail s'inscrit dans la montée des modèles « monde-action » et des approches VLA (vision-langage-action), qui réutilisent les a priori des modèles vidéo pour piloter des robots. Il en propose une variante efficace pour la navigation aérienne, face aux pipelines « générer puis reconstruire ». Aucun acteur industriel n'est cité, et aucun acteur français ou européen n'apparaît dans le résumé. Il s'agit d'un résultat de recherche publié sur arXiv, accompagné d'une page projet, sans produit ni déploiement commercial annoncé. La suite logique serait une validation sur d'autres bancs d'essai, des essais en extérieur à plus grande échelle et une comparaison publique avec d'autres méthodes de navigation par modèle vidéo.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
MoWAM : prédiction explicite du mouvement futur pour des modèles monde-action efficaces
2arXiv cs.RO 

MoWAM : prédiction explicite du mouvement futur pour des modèles monde-action efficaces

Un nouveau papier de recherche publié sur arXiv (référence 2609.20709v1) présente MoWAM, un modèle d'action du monde, ou World Action Model (WAM), destiné à l'apprentissage de politiques robotiques pour la manipulation. Contrairement aux WAM classiques qui génèrent explicitement des vidéos du futur pendant l'inférence pour anticiper la dynamique de l'environnement, ce qui alourdit considérablement le calcul, MoWAM remplace cette génération vidéo par une prédiction explicite du mouvement futur du robot. Le système repose sur une architecture Mixture-of-Transformer qui apprend la dynamique visuelle future pendant l'entraînement tout en prédisant conjointement mouvement et action, ce qui permet de supprimer entièrement la génération vidéo au moment de l'inférence tout en conservant une représentation explicite du futur. Les auteurs ont évalué le modèle sur les bancs d'essai de simulation LIBERO et LIBERO-Plus ainsi que sur des tâches de manipulation en conditions réelles. Le papier s'attaque à un compromis classique du secteur: retirer la génération vidéo future accélère l'inférence, mais risque de ne laisser la dynamique future qu'implicitement encodée dans les caractéristiques d'observation, ce qui fragilise les politiques face aux changements de distribution, un problème central pour tout intégrateur déployant un robot hors du cadre exact de son entraînement. En modélisant le mouvement comme une abstraction compacte du futur, MoWAM revendique une performance solide en distribution, une robustesse accrue hors distribution, et un taux de succès moyen supérieur en conditions réelles face à des WAM de référence. Point notable pour la mise à l'échelle au moment de l'inférence: la représentation compacte du mouvement permet d'échantillonner plusieurs candidats de paires mouvement-action et de les départager via un vérificateur de progression de tâche, avec des gains de performance croissants à mesure que davantage de candidats sont explorés, un signal que l'inférence-time scaling, déjà exploité pour les grands modèles de langage, commence à trouver une traduction concrète en robotique manipulatrice. MoWAM s'inscrit dans la lignée des World Action Models, qui enrichissent l'apprentissage de politiques robotiques d'une anticipation de la dynamique future, en complément des approches vision-langage-action plus directes. Il s'agit ici d'une contribution de recherche évaluée sur des bancs d'essai standards et un nombre limité de tâches réelles, sans acteur industriel, calendrier de déploiement, coûts ni volumes annoncés. L'argument central, à savoir qu'une modélisation explicite mais compacte du mouvement futur peut remplacer la coûteuse génération vidéo sans sacrifier la robustesse, mérite d'être suivi à mesure que des équipes tenteront de le reproduire sur des politiques robotiques destinées à la production plutôt qu'à la démonstration.

RechercheOpinion
1 source
WAM-OPD : distillation on-policy pour les modèles d'action du monde
3arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace
4arXiv cs.RO 

SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace

Des chercheurs publient sur arXiv (2610.02120) SkeleWAM, un modèle « world action » (WAM) compact pour la manipulation robotique. Un WAM combine la génération d'actions du robot avec la prédiction d'états futurs. La plupart des WAM existants prédisent des vidéos ou des latents visuels appris. Le nouveau modèle représente plutôt la scène sous la forme d'un squelette 3D épars, composé des articulations du robot, des centres d'objets et de points d'interaction. Ce squelette est construit en ligne à partir des images RGB-D courantes et de la proprioception du robot. Il sert d'état géométrique unique pour générer les actions et prédire les squelettes futurs, ce qui apporte une supervision géométrique supplémentaire sans reconstruction visuelle. À l'inférence, le modèle produit les actions directement depuis le squelette courant et l'instruction en langage naturel. Une stratégie auxiliaire, Medoid Action Consensus (MAC), sélectionne parmi plusieurs échantillons d'actions stochastiques un consensus représentatif. Sur le benchmark LIBERO-Plus, SkeleWAM atteint 85,9 % de réussite globale avec 57,1 millions de paramètres, soit 3,7 points de plus que Cosmos-Policy. L'intérêt tient au compromis entre performance et taille. Les WAM fondés sur la vidéo ou sur des latents visuels portent des informations d'apparence sans rapport avec le contrôle et ne codent la géométrie d'interaction qu'implicitement. Avec 57,1 M de paramètres, SkeleWAM se situe très en dessous des modèles de fondation de type VLA, qui comptent en général plusieurs milliards de paramètres. Si l'approche tient hors benchmark, elle ouvre la voie à des politiques embarquables sur du calcul modeste, un point décisif pour les intégrateurs qui visent des cellules industrielles sans GPU lourd. Elle suggère aussi qu'un état structuré, centré sur les relations robot-objet, peut suffire à remplacer la prédiction de pixels. Des réserves s'imposent : LIBERO-Plus est un benchmark en simulation, qui évalue la robustesse à des perturbations, et l'écart de 3,7 points reste modeste. Aucun test sur robot réel n'est mentionné dans le résumé. Enfin, la construction du squelette suppose une perception RGB-D fiable, ce qui déplace une partie de la difficulté vers l'estimation des centres d'objets et des points d'interaction en conditions réelles. SkeleWAM s'inscrit dans la montée des world action models, qui cherchent à marier politique et modèle du monde, avec Cosmos-Policy comme référence directe de la comparaison. La tendance dominante a consisté à prédire des vidéos futures, coûteuses en calcul. Les travaux récents explorent des représentations plus sobres, géométriques ou latentes, pour réduire ce coût. Les auteurs publient une page de projet (skelewam-project.github.io). La suite logique serait une validation sur matériel réel, sur des tâches variées et dans des environnements encombrés, ainsi qu'une comparaison avec les grands VLA sur des benchmarks complémentaires. Il s'agit pour l'instant d'une préimpression, sans produit ni déploiement associé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source