
Attrape-moi si tu peux : débruitage du retour en temps réel pour des VLA plus réactifs
Des chercheurs présentent VLA-Feedback, une architecture pour modèles vision-langage-action (VLA) qui corrige en temps réel les gestes d'un bras robotique pendant leur exécution, décrite dans un article publié sur arXiv (2609.21022v1). Elle répond à une limite connue des générateurs d'actions par diffusion, qui produisent un bloc de mouvements en une seule passe puis l'exécutent en boucle ouverte, sans réagir aux changements survenant dans la scène. VLA-Feedback combine une planification par diffusion à basse fréquence et un retour visuel à haute fréquence, qui ajuste chaque action juste avant son exécution via la dernière étape de débruitage du modèle, sans relancer l'ensemble du pipeline vision-langage. Sur le benchmark statique LIBERO, ses résultats égalent ceux de GR00T. Sur des tâches dynamiques en simulation, le taux de réussite moyen grimpe de 27,5% à 85,0%; sur robot réel, il passe de 51% à 73%.
Ce résultat cible un point de friction central pour l'industrialisation des VLA: la plupart des démonstrations de manipulation robotique sont tournées en environnement figé, où rien ne bouge entre la perception et l'action. Dès qu'un objet est déplacé ou qu'un contact change en cours de mouvement, les politiques en boucle ouverte échouent ou exigent une replanification complète, coûteuse en latence. En conservant l'expressivité du planificateur par diffusion tout en ajoutant une correction visuelle continue, VLA-Feedback propose une piste concrète pour réduire l'écart entre démonstration et usage réel en usine ou en entrepôt, où les scènes évoluent en permanence, un enjeu direct pour les intégrateurs qui évaluent le risque de déployer des bras pilotés par VLA hors laboratoire.
Les VLA se sont imposés ces deux dernières années comme l'approche dominante pour la manipulation robotique généraliste, en combinant des modèles vision-langage préentraînés avec des politiques d'action par diffusion. GR00T, utilisé ici comme référence de comparaison, est développé par NVIDIA et sert de socle à plusieurs déploiements humanoïdes annoncés dans le secteur. D'autres approches, comme Pi-0 de Physical Intelligence ou Helix de Figure AI, explorent elles aussi des architectures à deux échelles de temps, signe que la réactivité en boucle fermée est identifiée comme un verrou majeur par l'ensemble du secteur. VLA-Feedback reste à ce stade une contribution académique: les auteurs renvoient vers une page de projet dédiée pour les documents complémentaires, sans calendrier de déploiement industriel ni partenariat annoncé.
Dans nos dossiers




