SteerQuant : orienter l'erreur de quantification par une mise à l'échelle guidée par les actions dans les modèles monde-action
Des chercheurs publient SteerQuant, un cadre de quantification 4 bits conçu pour les « world-action models » (WAMs), ces modèles qui génèrent conjointement des états futurs du monde et des actions par débruitage itératif. Un même jeu de poids traite des flux hétérogènes (tokens vidéo, proprioceptifs et d'action). Le système associe une cartographie de l'effet des erreurs de quantification de chaque flux sur l'action finale à un calibrage du scaling des canaux partagés, puis ajuste le scaling des activations par flux et par étape de débruitage. Il s'accompagne de Rudder, un moteur d'inférence 4 bits qui fusionne scaling et compensation de sortie dans les kernels bas débit. En W4A8 et W4A4, le taux de succès moyen sur LIBERO reste à 0,8 point de pourcentage du modèle pleine précision, avec jusqu'à 2,23 fois d'accélération du débruitage face au BF16 sur trois WAMs, et une mémoire GPU de pointe réduite. Sur un robot réel à deux bras, le déploiement W4A8 offre un gain de 1,35 fois en inférence de bout en bout, à succès moyen constant par rapport au BF16.
L'enjeu tient à un constat simple : en contrôle, la précision numérique ne suffit pas comme critère. Une même erreur de quantification n'a pas le même effet selon le flux où elle survient, et une erreur sur un token vidéo peut compter bien moins qu'une erreur sur un token d'action. En orientant l'erreur vers les calculs qui pèsent peu sur l'action finale, sans dupliquer les poids ni monter la précision de certains flux, la méthode évite les compromis habituels de la quantification mixte. Pour les intégrateurs, c'est une piste concrète pour embarquer des WAMs, jusqu'ici lourds à cause du débruitage itératif, sur des GPU embarqués limités en mémoire et en latence. Le chiffre réel mérite toutefois lecture attentive : 1,35 fois en bout en bout contre 2,23 fois sur le seul débruitage montre que le gain se dilue dès que l'on mesure la chaîne complète. LIBERO reste de plus un benchmark de simulation, et l'essai réel se limite à un robot à deux bras dont le détail des tâches n'est pas donné ici.
Ces travaux s'inscrivent dans la montée des modèles qui prédisent à la fois le monde et l'action, en complément des VLA (vision-langage-action) comme Pi-0 ou GR00T. Ces modèles sont coûteux en calcul, ce qui freine leur passage en production. La quantification 4 bits était déjà éprouvée sur les LLM et sur certains VLA, mais peu adaptée à ces architectures multi-flux. Il s'agit d'une prépublication arXiv, non évaluée par des pairs, sans annonce de produit ni de pilote industriel. La suite logique serait une validation sur davantage de plateformes, de tâches longues et de matériels embarqués, ainsi qu'une éventuelle ouverture du code de Rudder.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




