REACT : débruitage glissant et double découplage pour un contrôle réactif des robots avec des modèles VLA
Des chercheurs publient sur arXiv (2610.12007) REACT, un cadre de « rolling denoising » destiné aux modèles vision-langage-action (VLA) à base de flow matching, ces modèles qui génèrent des séquences d'actions (« action chunks ») pour produire des mouvements de robot cohérents dans le temps. Au lieu de régénérer un chunk complet à chaque cycle, REACT maintient un tampon d'actions persistant dont les blocs sont à des pas de débruitage échelonnés. À chaque pas de contrôle, tout l'horizon est débruité avec l'observation la plus récente, le bloc le plus « propre » est exécuté, les blocs partiellement raffinés sont décalés vers l'avant et du bruit frais est ajouté en queue. Chaque action est ainsi affinée sur plusieurs observations successives avant d'être envoyée au robot. Un second volet, le « dual decoupling », sépare la perception, l'encodage par le VLM, le débruitage par le DiT (diffusion transformer) et l'exécution des actions, ce qui permet des mises à jour d'observation à haute fréquence et un flux d'actions continu sous des contraintes de calcul réalistes. L'évaluation couvre le benchmark de simulation RoboTwin 2.0 et des tâches réelles de manipulation bimanuelle et de contrôle dynamique sur plusieurs plateformes robotiques. Les auteurs revendiquent un meilleur taux de réussite, une latence de réaction réduite et des trajectoires plus lisses que les méthodes de replanification fréquente et les approches asynchrones. Le résumé ne donne aucun chiffre précis, ni fréquence de contrôle, ni gain en points de succès.
L'enjeu est un compromis structurel des VLA actuels. Des chunks longs donnent des mouvements fluides mais un robot lent à réagir à une perturbation, tandis qu'une replanification fréquente améliore la réactivité au prix de discontinuités qui abîment la qualité du geste, voire le matériel. Pour un intégrateur, cela touche directement les tâches dynamiques (objets mobiles, convoyeurs, interaction avec des humains) où les démonstrations de VLA restent souvent cantonnées à des scènes quasi statiques. Si les gains se confirment, REACT montrerait qu'on peut gagner en réactivité par l'architecture d'inférence, sans réentraîner de modèle plus gros. Il faut toutefois rester prudent : il s'agit d'un preprint non évalué par les pairs, et la comparaison porte sur des baselines choisies par les auteurs. L'absence de chiffres de latence dans le résumé empêche pour l'instant de juger si le gain est marginal ou décisif.
Cette approche s'inscrit dans une série de travaux sur le temps réel des VLA. Les chunks d'actions issus de la diffusion ou du flow matching, popularisés par des modèles comme Pi-0, ont imposé ce dilemme, et des méthodes asynchrones ou de « real-time chunking » ont tenté de le contourner en exécutant l'inférence en parallèle du mouvement. REACT s'en distingue en transposant au contrôle robotique l'idée du débruitage glissant (rolling diffusion), déjà utilisée en génération vidéo, et en y ajoutant la séparation des composants pour tenir les contraintes de calcul embarquées. La suite dépendra de la publication du code, de mesures sur des cycles de contrôle réels et de tests sur d'autres familles de VLA, en particulier celles qui visent le déploiement industriel.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




