Au-delà de la prédiction du futur : le débruitage comme adaptation générative pour le contrôle des robots
Des chercheurs publient sur arXiv (arXiv:2609.28339v1) une méthode baptisée NowWAM pour entraîner des politiques de contrôle robotique à partir de Diffusion Transformers (DiT) pré-entraînés sur de la génération d'images et de vidéos. Plutôt que de prédire des images futures pour transférer ce prior génératif vers le contrôle, comme le font la plupart des approches existantes, NowWAM débruite l'observation courante et prédit les actions du robot à partir du même flux visuel, sans cible visuelle future séparée. Sur le benchmark de simulation LIBERO-Plus, avec un backbone FLUX2-Klein, la méthode atteint 87,7 % de réussite, soit 6,1 points de plus qu'une base entraînée avec prédiction du futur, tout en divisant par deux le nombre de tokens visuels d'entraînement (784 à 392) et en réduisant le temps par étape de 2,85 à 1,63 seconde, un gain de vitesse de 1,8x. Avec un backbone texte-vers-image pur, Z-Image, sans capacité de génération vidéo ni d'édition d'image, NowWAM atteint 87,8 %.
Le résultat central du papier est que restreindre l'entraînement au seul point d'arrivée débruité dégrade nettement la robustesse, alors que remplacer la cible future par la cible présente ne change quasiment rien aux performances. Cela suggère que ce n'est pas la prédiction du futur en tant que telle qui rend utile le prior génératif des DiT pour le contrôle, mais la trajectoire de débruitage elle-même, utilisée comme interface d'apprentissage. Pour le secteur des politiques robotiques de type VLA (vision-language-action), bâties sur des bases génératives comparables à celles derrière Pi-0 ou GR00T N2, ce travail remet en cause l'hypothèse répandue selon laquelle un module de prédiction vidéo du futur serait nécessaire pour exploiter un prior génératif. Il ouvre aussi une piste d'efficacité concrète: moitié moins de tokens visuels et un temps de calcul par étape quasi divisé par deux, un enjeu direct pour le contrôle temps réel embarqué.
Ce travail s'inscrit dans la tendance à construire des politiques de contrôle sur des DiT pré-entraînés à grande échelle, une lignée qui inclut des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, généralement adaptés via prédiction visuelle du futur. NowWAM se positionne comme une alternative de co-entraînement plus économe, comparée sous conditions contrôlées à une base "future prédiction" sur LIBERO-Plus, un environnement de simulation standard pour la manipulation, et non un déploiement sur robot réel. Les auteurs montrent que l'adaptation au contrôle ne dépend pas d'un backbone spécialisé en vidéo ou en édition d'image, élargissant les bases génératives exploitables en robotique. Publié en preprint, l'article ne mentionne aucun déploiement industriel ni partenariat commercial; ses conclusions restent à confirmer au-delà du benchmark simulé.
Dans nos dossiers




