Quantification bas-débit native des modèles vision-langage-action via repliement cohérent : FoldQuantVLA
Des chercheurs détaillent FoldQuantVLA, un framework de quantification post-entraînement pour modèles vision-langage-action (VLA), dans un preprint publié sur arXiv (2609.24433v1). La méthode préserve une représentation d'activation cohérente de la calibration jusqu'à l'exécution native en entiers, en combinant mise à l'échelle par canal, transformées de Hadamard par blocs et quantification dynamique par token, sans réentraîner la politique. Des plugins TensorRT exécutent en 4 bits (poids et activations, W4A4) les projections du backbone langage et de l'expert d'action, sur GPU Ada et sur Jetson AGX Orin. Testé sur LIBERO, SimplerEnv, trois checkpoints GR00T et π_0.5, le W4A4 gagne 1,20 à 1,33x sur Orin et 1,25 à 1,52x sur desktop face à TensorRT en flottant. En repassant certaines projections du module langage en 8 bits, le succès de GR00T N1.7 sur quatre tâches réelles grimpe de 80,0% à 92,5% sur 80 essais par configuration, pour 1 ms de latence supplémentaire sur Orin.
Pour les intégrateurs, l'enjeu n'est pas le gain de vitesse, modeste (1,2 à 1,5x), mais la preuve qu'une quantification agressive et uniforme dégrade mesurablement le comportement du robot : la chute de 92,5% à 80,0% de succès entre configuration mixte et W4A4 uniforme montre que la latence gagnée coûte cher à la fiabilité si le compromis bits/couches est mal calibré. La méthode permet d'exécuter des VLA volumineux directement sur du matériel embarqué comme le Jetson Orin, sans datacenter ni réentraînement, réduisant le coût d'ingénierie du déploiement en périphérie. Elle offre aux décideurs B2B une méthode reproductible pour arbitrer précision et vitesse couche par couche, plutôt qu'un choix binaire entre flottant complet et quantification uniforme.
Le travail s'inscrit dans les efforts pour exécuter en temps réel des VLA de référence comme GR00T N1.7 (NVIDIA) et π_0.5 (Physical Intelligence), conçus sur GPU de datacenter mais visés pour l'inférence embarquée. FoldQuantVLA adapte au contexte robotique des techniques de compression déjà connues pour les grands modèles de langage, scaling par canal et transformées de Hadamard, couplées à une quantification dynamique par token propre à la boucle observation-action. Le preprint, soumis en septembre 2026, ne précise ni affiliation industrielle ni calendrier de production ; les tests reposent sur deux plateformes robotiques réelles non identifiées, sans code public ni partenariat annoncé avec un fabricant de robots.
Dans nos dossiers




