Aller au contenu principal
AnyStep-WAM : distillation alignée sur le budget et inférence adaptative pour les modèles d'action du monde
RecherchearXiv cs.RO 

AnyStep-WAM : distillation alignée sur le budget et inférence adaptative pour les modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent AnyStep-WAM, un cadre qui rend ajustable le nombre d'étapes de débruitage des « world action models » (WAM). Ces modèles couplent une prédiction visuelle de la scène à la génération d'actions, et reposent aujourd'hui sur un débruitage itératif à nombre d'étapes fixe. La méthode combine deux briques. D'abord, une distillation « budget-aligned » à partir de trajectoires d'un modèle enseignant gelé, qui entraîne des flow maps conditionnées par l'intervalle de temps, avec des adaptateurs low-rank partagés. Le modèle peut ainsi générer des actions en une seule étape ou en plusieurs étapes de raffinement. Ensuite, un ordonnanceur léger « risque-bénéfice » estime, à partir d'un unique aperçu en une étape, la difficulté de la scène (courbure de la trajectoire de l'enseignant) et la fidélité attendue de l'élève pour chaque budget. Il retient le plus petit budget qui satisfait l'exigence de fidélité adaptée au risque. Les tests portent sur trois WAM très utilisés, Motus, FastWAM et LingBotVA, sur le benchmark RoboTwin 2.0. Le nombre moyen d'étapes de débruitage baisse de 60,2 %, 49,8 % et 85,28 % respectivement, à taux de réussite inchangé. À budget d'une seule étape, l'entraînement AnyStep améliore le taux de succès de 7,07, 12,08 et 8,94 points ou pourcentages (l'article ne précise pas) selon le modèle. Six tâches de manipulation réelles viennent compléter l'évaluation.

L'enjeu est la latence de décision, un des freins à l'utilisation de modèles génératifs sur des robots réels. Le débruitage à coût constant gaspille du calcul sur les gestes faciles, comme l'approche ou le transport, alors que seuls les gestes critiques (insertion, saisie fine) exigent de la précision. Allouer le calcul selon la scène rapproche les WAM de fréquences de contrôle compatibles avec des cadences industrielles, sans changer de modèle de base. Le fait que la méthode s'applique à trois architectures distinctes suggère une approche générique plutôt qu'un réglage sur mesure, ce qui intéresse les intégrateurs qui comparent coûts d'inférence et embarqué. Il faut toutefois rester prudent : les gains les plus nets sont mesurés en simulation, sur RoboTwin 2.0. Les six tâches réelles ne sont pas détaillées dans le résumé, et aucun temps de cycle ni gain de latence en millisecondes n'est donné, seulement des réductions d'étapes. La réduction d'étapes ne se traduit pas mécaniquement en gain de temps mesuré sur matériel.

Ce travail s'inscrit dans une série de recherches qui cherchent à accélérer les politiques génératives, après les flow maps, la distillation en une étape et les modèles consistency. Les WAM, qui apprennent à prédire l'évolution visuelle du monde avec les actions, se placent en alternative aux VLA (vision-language-action) comme Pi-0 ou GR00T, au prix d'un calcul plus lourd. C'est ce surcoût que AnyStep-WAM vise à réduire. Il s'agit d'un preprint arXiv (version 2 du 2609.33748), sans relecture par les pairs ni déploiement industriel annoncé. La suite logique serait une validation sur plus de tâches réelles, avec mesure de la latence de bout en bout et de la robustesse hors distribution.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

WAM-OPD : distillation on-policy pour les modèles d'action du monde
1arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
Flash-WAM : distillation sensible aux modalités pour les modèles monde-action
2arXiv cs.RO 

Flash-WAM : distillation sensible aux modalités pour les modèles monde-action

Des chercheurs ont publié Flash-WAM (arXiv:2606.05254v1), une méthode de distillation conçue pour accélérer les "world-action models" (WAMs), des architectures de diffusion qui génèrent simultanément une prédiction vidéo du futur et les commandes robot associées. Le verrou que Flash-WAM tente de lever : ces modèles nécessitent des dizaines de passes de débruitage par chunk d'actions, aboutissant à une latence de 8,1 secondes par chunk sur GPU NVIDIA L40S, ce qui exclut tout contrôle en temps réel. En compressant l'inférence à une seule étape par modalité via une distillation par consistance adaptée, Flash-WAM ramène cette latence à 348 ms, soit un facteur 23x. Appliqué au modèle LingBot-VA, il atteint 85,5% de succès sur le benchmark RoboTwin 2.0, 95,7% sur LIBERO, et 60% en moyenne sur un humanoïde réel Unitree G1. L'originalité de Flash-WAM réside dans le traitement asymétrique des deux modalités. Le flux action et le flux vidéo dans un WAM opèrent sur des schedules de bruit fondamentalement différents (SNR-shifted noise schedules) : appliquer une seule paramétrisation à l'ensemble dégrade les performances de façon sévère, la distillation naïve par consistance chutant à 24% de succès en conditions réelles. Flash-WAM contourne ce problème avec une paramétrisation linéaire à gradient scalé pour le flux action (régime faible bruit) et une paramétrisation variance-preserving pour le flux vidéo (régime fort bruit). Ce résultat valide l'idée qu'un robot peut boucler en temps réel sur ses prédictions de monde sans matériel exotique, à condition d'adapter la distillation à la nature propre de chaque signal. Les WAMs s'inscrivent dans une tendance récente fusionnant prédiction vidéo et politique robot dans un modèle de diffusion unifié, une approche portée par des travaux comme GR00T N2 de NVIDIA, Pi-0.5 de Physical Intelligence, ou les VLAs (vision-language-action models) au sens large. LingBot-VA est l'un de ces modèles joints récents sur lequel Flash-WAM est instancié. Le sim-to-real gap demeure visible dans les résultats (60% en réel contre 85,5% en simulation sur RoboTwin 2.0), mais le gain de 36 points sur la distillation naïve confirme la pertinence de l'approche pour des déploiements futurs sur manipulateurs industriels ou humanoïdes à usage général.

RechercheOpinion
1 source
SplineWAM : des horizons d'action adaptatifs pour les modèles du monde et d'action grâce aux B-splines
3arXiv cs.RO 

SplineWAM : des horizons d'action adaptatifs pour les modèles du monde et d'action grâce aux B-splines

Des chercheurs publient SplineWAM (arXiv 2609.39873), une méthode qui change la façon dont les « world action models » (WAM) découpent leurs actions dans le temps. Un WAM est une grande politique robotique qui prédit conjointement la vidéo future et les actions à exécuter, et renvoie à chaque appel d'inférence un segment d'actions de longueur fixe (action chunk). SplineWAM compresse au contraire la trajectoire dans une fenêtre de taille fixe de paramètres de B-splines cubiques, dont les instants de nœuds s'ajustent aux caractéristiques du mouvement. Un même budget de paramètres peut ainsi se décoder en segments de résolution et de durée variables, et la durée exécutée comme l'intervalle avant le prochain appel découlent de la prédiction elle-même. La supervision vidéo est alignée sur les nœuds ajustés de la démonstration plutôt que sur une grille uniforme, ce qui concentre les images supervisées là où la trajectoire est complexe. Pour l'exécution asynchrone, les auteurs introduisent JP-RTC (Jacobian-Pullback Real-Time Chunking), qui impose la continuité sur les actions brutes exécutées par le robot, et non sur les paramètres de la spline. Les paramètres sont corrigés via le décodeur pour que le début du segment coïncide avec les actions déjà engagées. Sur LIBERO-Plus et RoboCasa, le taux de réussite gagne 8,2 et 4,4 points face à un WAM à action chunking classique, avec 22 % et 26 % d'appels de politique en moins par épisode. Sur trois tâches bimanuelles réelles en mode asynchrone, SplineWAM fait mieux ou égale la référence tout en décodant 1,2 à 1,6 fois plus de mouvement exécuté par appel. L'enjeu est surtout économique et opérationnel. Un WAM uniforme dépense autant de calcul sur un déplacement en espace libre que sur une insertion riche en contacts, ce qui plafonne le débit lorsque la politique tourne dans le cloud, où chaque appel coûte de la latence et du GPU. Moins d'appels pour un succès égal ou supérieur laisse envisager de servir davantage de robots par accélérateur, ou de tolérer des liaisons plus lentes. Le résultat nuance aussi l'idée qu'un horizon d'action fixe est un détail d'implémentation neutre : le choisir de façon adaptative semble améliorer à la fois la qualité et l'efficacité. Des réserves s'imposent toutefois. Les gains en simulation sont modestes, et les résultats réels, limités à trois tâches, indiquent « mène ou égale » la référence, ce qui n'est pas une victoire nette. Le papier ne donne pas, dans son résumé, de mesure de latence de bout en bout ni de coût par tâche. Le contexte est celui de la montée des WAM, qui prolongent les VLA (vision-langage-action) en ajoutant la prédiction vidéo pour mieux ancrer la physique des tâches. Le problème de la continuité entre segments successifs a été traité jusqu'ici par le real-time chunking, que JP-RTC reprend en l'adaptant à une représentation paramétrique. Les B-splines, courantes en planification de trajectoire, entrent ainsi dans la conception des politiques apprises. Les benchmarks utilisés, LIBERO-Plus et RoboCasa, sont des environnements de simulation de référence, mais leur transfert à des cellules industrielles reste à démontrer. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé : il s'agit d'une préversion de recherche, dont la validité dépendra d'une réplication sur d'autres plateformes et d'une mesure du gain réel en coût de service cloud.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action
4arXiv cs.RO 

StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action

Publié le 22 septembre 2026 sur arXiv sous la référence 2609.22684, StateMem est un nouveau framework de mémoire pour les politiques vision-langage-action (VLA) utilisées en manipulation robotique. Plutôt que de s'appuyer sur des banques de mémoire externes comme celles de MemoryVLA, il maintient un unique token de mémoire persistant mis à jour par résidus de faible rang et route de façon adaptative les préfixes mis en cache, avec un contrôleur sans entraînement ajustant le seuil en ligne et une correction rapide compensant la dérive des données en cache. Sur le benchmark LIBERO, StateMem atteint 97,6% de réussite moyenne tout en réduisant de 20,25% la fréquence de rafraîchissement complet du préfixe du modèle vision-langage. Sur RoboMemArena, catégorie Occlusion, il devance les autres méthodes VLA isolées avec 21,8% de taux de succès par tâche et 44,3% de taux de succès cumulé, et gagne 21 points de réussite moyenne sur six tâches de manipulation réelle. L'enjeu est concret pour l'industrie: la manipulation robotique dépendante de la mémoire, où une action tardive doit exploiter une information vue plus tôt, comme un objet temporairement caché, reste un point faible des VLA qui ne regardent que l'observation courante. En évitant le stockage et la récupération explicites d'une mémoire externe, StateMem allège le pipeline d'inférence et réduit le calcul redondant, un critère décisif pour la latence et le coût de calcul embarqué en déploiement temps réel. Les gains en environnement d'occlusion sont particulièrement significatifs car ils ciblent l'écart entre démonstrations de laboratoire et conditions réelles d'usine ou d'entrepôt, où l'occlusion visuelle est fréquente. Le travail s'inscrit dans la lignée des politiques VLA qui cherchent à dépasser la réaction à l'instant présent pour intégrer un raisonnement temporel, en se positionnant comme alternative plus légère aux architectures à mémoire externe explicite telles que MemoryVLA. Les auteurs valident leur approche sur trois terrains complémentaires, la suite standardisée LIBERO, le benchmark récent RoboMemArena axé sur mémoire et occlusion, et des tâches réelles sur robot physique, limitant le risque de sur-optimisation à un seul environnement simulé. Déposé en pré-publication sans mention de licence commerciale ni de partenariat industriel, StateMem reste à ce stade une contribution de recherche dont l'adoption en production dépendra de sa reproduction indépendante.

RechercheActu
1 source