
R²-WAM : post-entraînement par réparation et rejet pour les modèles d'action du monde
Des chercheurs proposent R²-WAM, un cadre de post-entraînement en deux étapes, « réparer puis rejeter », destiné aux World Action Models (WAM). Ces modèles prédisent, sous forme de vidéo, les conséquences d'actions robotiques échantillonnées, afin d'affiner une politique de contrôle. Le système atteint 93,8 % de succès moyen sur le benchmark de simulation RoboTwin 2.0, en moyenne sur les configurations « clean » et randomisées. Sur une tâche réelle de longue durée, le pliage de chemise (Fold Shirt), il obtient 87,5 % de succès moyen, contre 0 % pour Fast-WAM, la base de comparaison. Le gain est obtenu sans interaction supplémentaire avec l'environnement et sans modification de la procédure d'inférence. Le code et les démonstrations sont annoncés sur une page projet dédiée.
Le mécanisme tient en deux temps. L'étape de réparation corrige un défaut connu des WAM : une vidéo prédite visuellement plausible peut ne pas refléter l'action fournie en entrée, ce qui fausse tout raffinement de politique fondé sur elle. Les auteurs introduisent un score d'alignement cinématique, qui mesure l'écart entre le mouvement prédit et le mouvement démontré, pour ancrer l'imagination du modèle dans le comportement réel du robot. L'étape de rejet utilise ensuite ce modèle vidéo réparé pour comparer les résultats imaginés des actions échantillonnées à ceux des démonstrations. Les échantillons dont la progression de tâche prédite tombe sous la référence démontrée d'une marge prescrite servent d'exemples négatifs pour un fine-tuning négatif.
L'intérêt dépasse le score de benchmark. Le résultat suggère que la prédiction vidéo peut passer du statut de simple apprentissage de représentations à celui de critique de conséquences, capable de trier les mauvaises actions hors ligne. Cela réduit le besoin de rollouts physiques coûteux, un point clé pour les intégrateurs confrontés au coût de collecte de données. Le contraste sur Fold Shirt est frappant : 0 % pour la base de comparaison indique que la cohérence action-vidéo est un goulot d'étranglement réel sur les tâches déformables à long horizon. Il faut toutefois rester prudent : il s'agit d'un travail académique, la tâche réelle est unique, le nombre d'essais n'est pas précisé dans le résumé, et aucun déploiement industriel ni temps de cycle n'est évoqué.
Ce travail s'inscrit dans la montée des modèles du monde appliqués au contrôle, où la vidéo prédictive sert de fondation aux politiques, en parallèle des approches VLA (vision-langage-action) classiques. RoboTwin 2.0, benchmark bimanuel en simulation, est devenu un terrain de comparaison courant, et Fast-WAM représente ici l'état de l'art immédiat auquel les auteurs se mesurent. La suite logique serait une validation sur davantage de tâches réelles, d'autres plateformes et des volumes d'essais plus larges, ainsi qu'une comparaison avec les politiques VLA déployées commercialement. Aucun acteur européen ni calendrier de pilote n'est mentionné dans cette version de l'article, publiée sur arXiv en révision (v2).
Pas d\'impact direct sur la France/UE
Dans nos dossiers




