
VLAQuantBench : évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action
Des chercheurs ont publié VLAQuantBench, un protocole d'évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action, construit sur 409 runs et 94 574 épisodes de simulation, avec quatre modèles testés sur le benchmark LIBERO et X-VLA évalué en plus sur trois autres familles de benchmarks de simulation. Sous une quantification W4A4 non calibrée (poids et activations sur 4 bits), étendre le sous-ensemble de couches de la tête d'action de π0.5 de 126 à 167 couches fait bondir le taux de réussite de 7,0% à 70,5%, un gain confirmé par rejeu à observations fixes. Une calibration limitée à deux épisodes supprime les échecs sévères observés sur les sous-ensembles testés, mais la même recette de lissage et d'écrêtage dégrade le score de π0 et ne suffit pas à restaurer OpenVLA-OFT de bout en bout, qui exige de protéger une seule projection de sortie de 28 672 paramètres pour retrouver une performance quasi égale à la référence, le reste du réseau (441 couches linéaires) pouvant alors tourner en poids 3 bits sur LIBERO-Long ou en activations 8 bits sur les quatre suites testées.
Ces résultats visent directement les équipes qui doivent faire tenir des VLA de plusieurs milliards de paramètres dans la mémoire limitée d'un contrôleur embarqué, un enjeu croissant pour les robots manipulateurs et humanoïdes commerciaux. Le constat principal invalide l'idée de règles de sensibilité par couche universelles et transférables d'un modèle à l'autre: une même recette de calibration peut sauver un modèle et en casser un autre, ce qui impose aux intégrateurs de valider chaque schéma de quantification modèle par modèle plutôt que de recycler des heuristiques génériques. L'étude montre aussi qu'un effondrement massif sous quantification agressive ne trahit pas forcément une fragilité intrinsèque du VLA, puisqu'un ajustement ciblé du périmètre de couches protégées, ou une simple calibration sur deux épisodes, peut faire passer la réussite de 7% à plus de 70%.
La quantification post-entraînement, technique éprouvée sur les grands modèles de langage, est de plus en plus reprise telle quelle pour les VLA sans validation poussée sur des tâches de manipulation en boucle fermée, un vide que ce travail comble en testant côte à côte π0, π0.5, OpenVLA-OFT et X-VLA. Le code, les configurations et les enregistrements d'épisodes sont publiés en accès libre sur GitHub, ce qui permet à d'autres équipes de reproduire ou d'étendre les assignations de précision identifiées. L'article, référencé arXiv:2609.25376, n'annonce ni nouveau modèle ni déploiement commercial, mais livre un outil méthodologique aux équipes de recherche et d'ingénierie qui arbitrent entre empreinte mémoire et fiabilité avant de faire tourner un VLA sur du matériel embarqué.
Dans nos dossiers




