FASA : adaptation de l'échantillonnage sensible au retour pour des modèles VLA à diffusion efficaces
Un article publié le 18 septembre 2026 sur arXiv (référence 2609.19475v1) présente FASA (Feedback-Aware Sampling Adaptation), une méthode d'accélération pour les modèles Vision-Language-Action (VLA) fondés sur la diffusion. Ces modèles, utilisés pour piloter des robots à partir d'images et de langage naturel, souffrent d'un défaut connu : leur processus de génération d'action repose sur un échantillonnage itératif coûteux en calcul et en accès mémoire, ce qui empêche leur exécution en temps réel sur du matériel embarqué limité. FASA fonctionne sans entraînement supplémentaire et agit directement au moment de l'inférence : un premier module, l'adaptateur de plage piloté par l'interaction, ajuste dynamiquement le nombre global d'étapes de débruitage en fonction du retour visuel et de la force mesurée par la pince du robot ; un second module, l'adaptateur d'étape sensible à la proprioception, choisit précisément l'étape optimale à l'intérieur de cette plage. Les auteurs annoncent des gains de vitesse d'inférence allant jusqu'à 1,45 fois par rapport aux méthodes existantes, avec des taux de réussite jugés comparables sur plusieurs bancs d'essai (benchmarks) non détaillés dans le résumé.
Cette approche cible un point de friction central pour l'industrialisation des VLA : les méthodes d'accélération existantes imposent soit un réentraînement coûteux (distillation, flow matching), soit un élagage ou un système de cache programmé de façon statique, qui dégrade la perception en ignorant la variabilité réelle de la charge de travail robotique. En traitant le retour multimodal comme signal de contrôle du pipeline de débruitage, FASA propose une troisième voie, sans coût d'entraînement, potentiellement pertinente pour les intégrateurs cherchant à déployer des modèles génératifs lourds sur des plateformes de calcul contraintes, comme les contrôleurs embarqués de robots manipulateurs.
Il s'agit toutefois d'un prépublication arXiv, non encore validée par relecture par les pairs, sans identification des auteurs ni de laboratoire dans le résumé disponible, et sans précision sur le matériel de test ni sur les modèles VLA de référence utilisés pour la comparaison. Le gain de 1,45x reste à situer par rapport aux architectures concurrentes d'accélération de l'inférence robotique, un axe de recherche actif à mesure que les modèles VLA gagnent en taille et en ambition d'usage industriel.
Dans nos dossiers




