Aller au contenu principal
R²-WAM : post-entraînement par réparation et rejet pour les modèles d'action du monde
RecherchearXiv cs.RO 

R²-WAM : post-entraînement par réparation et rejet pour les modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent R²-WAM, un cadre de post-entraînement en deux étapes, « réparer puis rejeter », destiné aux World Action Models (WAM). Ces modèles prédisent, sous forme de vidéo, les conséquences d'actions robotiques échantillonnées, afin d'affiner une politique de contrôle. Le système atteint 93,8 % de succès moyen sur le benchmark de simulation RoboTwin 2.0, en moyenne sur les configurations « clean » et randomisées. Sur une tâche réelle de longue durée, le pliage de chemise (Fold Shirt), il obtient 87,5 % de succès moyen, contre 0 % pour Fast-WAM, la base de comparaison. Le gain est obtenu sans interaction supplémentaire avec l'environnement et sans modification de la procédure d'inférence. Le code et les démonstrations sont annoncés sur une page projet dédiée.

Le mécanisme tient en deux temps. L'étape de réparation corrige un défaut connu des WAM : une vidéo prédite visuellement plausible peut ne pas refléter l'action fournie en entrée, ce qui fausse tout raffinement de politique fondé sur elle. Les auteurs introduisent un score d'alignement cinématique, qui mesure l'écart entre le mouvement prédit et le mouvement démontré, pour ancrer l'imagination du modèle dans le comportement réel du robot. L'étape de rejet utilise ensuite ce modèle vidéo réparé pour comparer les résultats imaginés des actions échantillonnées à ceux des démonstrations. Les échantillons dont la progression de tâche prédite tombe sous la référence démontrée d'une marge prescrite servent d'exemples négatifs pour un fine-tuning négatif.

L'intérêt dépasse le score de benchmark. Le résultat suggère que la prédiction vidéo peut passer du statut de simple apprentissage de représentations à celui de critique de conséquences, capable de trier les mauvaises actions hors ligne. Cela réduit le besoin de rollouts physiques coûteux, un point clé pour les intégrateurs confrontés au coût de collecte de données. Le contraste sur Fold Shirt est frappant : 0 % pour la base de comparaison indique que la cohérence action-vidéo est un goulot d'étranglement réel sur les tâches déformables à long horizon. Il faut toutefois rester prudent : il s'agit d'un travail académique, la tâche réelle est unique, le nombre d'essais n'est pas précisé dans le résumé, et aucun déploiement industriel ni temps de cycle n'est évoqué.

Ce travail s'inscrit dans la montée des modèles du monde appliqués au contrôle, où la vidéo prédictive sert de fondation aux politiques, en parallèle des approches VLA (vision-langage-action) classiques. RoboTwin 2.0, benchmark bimanuel en simulation, est devenu un terrain de comparaison courant, et Fast-WAM représente ici l'état de l'art immédiat auquel les auteurs se mesurent. La suite logique serait une validation sur davantage de tâches réelles, d'autres plateformes et des volumes d'essais plus larges, ainsi qu'une comparaison avec les politiques VLA déployées commercialement. Aucun acteur européen ni calendrier de pilote n'est mentionné dans cette version de l'article, publiée sur arXiv en révision (v2).

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Guidage sensible à l'achèvement pour les modèles du monde et d'action
1arXiv cs.RO 

Guidage sensible à l'achèvement pour les modèles du monde et d'action

Des chercheurs publient sur arXiv (2610.01559) une méthode baptisée Completion Aware Guidance (CAG), destinée aux World Action Models (WAMs). Ces modèles prédisent à la fois les futurs visuels et les actions du robot. Le travail cible un défaut précis, l'« imagination incomplète » : le modèle produit des prédictions plausibles et cohérentes avec les actions, mais qui omettent la transition nécessaire pour terminer la tâche. CAG est une méthode d'échantillonnage sans entraînement supplémentaire, qui oriente la génération vers l'achèvement de la tâche. Sur plusieurs WAMs représentatifs, le taux de succès passe de 64 % à 70 % sur un sous-ensemble de RoboTwin 2.0, et de 69 % à 75 % en simulation zéro-shot. La part d'imagination incomplète tombe de 79 % à 40 %. Les résultats portent sur des benchmarks simulés. L'article ne mentionne ni test sur robot réel, ni déploiement. L'intérêt tient d'abord au diagnostic. Selon les auteurs, l'échec ne vient pas de l'architecture du modèle du monde. Il apparaît quand ce modèle est adapté au contrôle par segments courts (short-chunk control). Dans ce régime, le modèle favorise de façon répétée des prolongements locaux plausibles plutôt que les transitions qui achèvent la tâche. Pour les équipes qui construisent des politiques VLA ou des WAMs, cela signale qu'une partie des échecs en manipulation vient de la procédure d'échantillonnage et d'adaptation, pas d'un manque de capacité du modèle de base. Corriger cela à l'inférence, sans réentraînement, est peu coûteux. Il faut toutefois relativiser : un gain de 6 points de succès reste modeste, et le chiffre le plus net, 79 % à 40 %, mesure un défaut défini par les auteurs eux-mêmes. Il ne se traduit pas directement en fiabilité industrielle. Ce travail s'inscrit dans l'essor des modèles qui apprennent à prédire l'avenir visuel pour guider l'action. L'approche est une alternative aux VLA purement réactifs, comme Pi-0 ou Helix. Elle est aussi un complément aux efforts de modèles du monde généralistes, tels que GR00T. RoboTwin 2.0 sert de banc d'essai standard pour la manipulation bimanuelle en simulation. Il reste donc à voir si le gain tient sur matériel réel, avec ses latences, son bruit de perception et ses contraintes de temps de cycle. Les auteurs n'annoncent pas de calendrier de validation physique. L'article n'évoque aucun acteur français ou européen.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
WAMJET : un cadre pour accélérer les modèles d'action du monde
2arXiv cs.RO 

WAMJET : un cadre pour accélérer les modèles d'action du monde

WAMJET, présenté sur arXiv (2610.03797, version 2), est un « harness » agentique qui accélère l'inférence des World Action Models (WAM). Ces modèles réutilisent des modèles de fondation vidéo pré-entraînés pour la manipulation robotique, en prédisant conjointement la vidéo future et les actions. Ce couplage et la taille des backbones rendent l'inférence coûteuse. Le harness dote des agents de code de consignes d'optimisation réutilisables et d'outils de mesure et de validation. L'agent suit un flux piloté par les goulots d'étranglement : il profile l'inférence, modifie le code ciblé, valide les effets, puis affine la pile d'accélération à mesure que les goulots se déplacent, sans dégrader la qualité des actions. Les expériences couvrent six WAM, trois agents de code et deux architectures de GPU. WAMJET atteint jusqu'à 9,95x d'accélération sans perte par rapport aux implémentations amont. Des optimisations par approximation et adaptées au matériel réduisent encore la latence, avec des taux de succès comparables. Ce travail s'attaque à un frein concret du déploiement des WAM : leurs latences d'inférence. Les techniques d'accélération existent déjà (quantification, distillation, réduction du nombre de pas de diffusion, optimisation des noyaux), mais choisir et composer celles qui conviennent à chaque modèle et à chaque plateforme matérielle demande un travail d'ingénierie lourd et répété. En automatisant cette étape avec des agents de code, les auteurs proposent de la traiter comme un problème d'optimisation outillé plutôt que comme du sur-mesure. Pour un intégrateur ou une équipe qui porte un WAM sur un robot réel, le gain de latence conditionne la fréquence de contrôle atteignable. Le résultat suggère aussi que les implémentations amont des WAM laissent beaucoup de performance inexploitée. Le chiffre de 9,95x est un maximum, obtenu sur le meilleur cas, et non une moyenne. L'extrait disponible ne détaille ni les latences absolues ni la liste des six modèles, ce qui limite la lecture de ce chiffre. La mention de taux de succès « comparables » pour les variantes approximatives demande à être vérifiée sur des tâches physiques variées, et pas seulement sur des benchmarks. Cette approche s'inscrit dans deux tendances. La première est la montée des modèles d'action fondés sur la vidéo, qui héritent de la qualité des modèles vidéo génératifs, mais aussi de leur coût de calcul, par opposition aux VLA classiques, plus légers. La seconde est l'usage d'agents de code pour optimiser des systèmes, sur le modèle de l'ingénierie assistée de noyaux GPU. Les travaux concurrents sur l'accélération des VLA, comme les politiques à flow matching ou à diffusion réduite en pas, visent le même objectif de contrôle temps réel, mais sans automatiser la composition des techniques. La suite logique est une validation sur robots physiques et sur davantage de plateformes, notamment embarquées, où les contraintes de calcul sont les plus fortes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
WAM-OPD : distillation on-policy pour les modèles d'action du monde
3arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
GlanceWAM : imagination parcimonieuse au moment du test pour les modèles monde-action
4arXiv cs.RO 

GlanceWAM : imagination parcimonieuse au moment du test pour les modèles monde-action

Des chercheurs publient sur arXiv GlanceWAM, une architecture de « world-action model » (WAM) qui sépare l'imagination visuelle du contrôle moteur sur un unique backbone vidéo de type DiT (Diffusion Transformer) partagé. Un module « proposeur » asynchrone tourne sur une horloge lente et génère en arrière-plan une seule image d'anticipation, projetée à quelques secondes dans le futur. En parallèle, une tête d'action décode des « chunks » d'actions au rythme du contrôle, soit 48 ms par chunk sur un seul GPU A100, entièrement dans l'espace latent et sans attendre la génération vidéo. Deux mécanismes rendent cela possible : un masque d'attention « non interférant » qui isole les représentations vidéo de celles de l'action, et un entraînement robuste à la péremption, qui prépare le modèle à exploiter une anticipation devenue légèrement ancienne. Entraîné uniquement sur démonstrations, le modèle atteint 72,2 % de réussite sur le benchmark RoboCasa (24 tâches de cuisine), contre 67,1 % pour Cosmos Policy en mode synchrone, et 99,0 % sur LIBERO. La latence par chunk est divisée par 24 par rapport aux WAM synchrones. En manipulation réelle, mono-bras et bimanuelle, il dépasse en moyenne π0.5 sans aucun pré-entraînement sur données robot. Le code est publié sur GitHub. L'enjeu est un compromis que les WAM n'avaient pas résolu. Générer de la vidéo à la fréquence de contrôle est trop lent pour un robot réel, alors que supprimer l'imagination au moment de l'inférence coûte en taux de réussite. Ici, les deux gains arrivent ensemble : l'anticipation sert de signal de guidage sans se trouver sur le chemin critique. Pour un intégrateur, cela rend plausible l'usage de priors issus de modèles vidéo sur du matériel standard, sans grappe de GPU dédiée au contrôle. Le résultat contredit aussi l'idée que la prédiction visuelle fine, image par image, serait nécessaire : une seule image future, consommée en latent, suffit. Quelques réserves s'imposent toutefois. Les chiffres viennent de benchmarks de simulation, où l'écart de 5 points avec Cosmos Policy reste modeste, et LIBERO est quasi saturé. Les essais réels, dont la taille n'est pas précisée dans le résumé, n'ont pas été validés indépendamment. Il s'agit d'un travail académique, pas d'un produit déployé. Ce travail s'inscrit dans la montée des modèles monde-action, qui réutilisent les modèles de génération vidéo pour doter les politiques robotiques d'une intuition physique. Cosmos Policy, de NVIDIA, en est la référence synchrone, et π0.5, de Physical Intelligence, représente la famille des VLA (vision-language-action) entraînés à grande échelle sur données robot. Le fait de battre π0.5 sans pré-entraînement robot suggère que les modèles vidéo pré-entraînés peuvent compenser en partie le manque de données de manipulation, un point sensible alors que ces corpus restent coûteux. La suite logique est de valider l'approche sur des tâches plus longues et sur d'autres plateformes, notamment les humanoïdes. Le code ouvert devrait permettre à d'autres équipes de reproduire et de contester ces résultats rapidement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source