AWQ(Activation-aware Weight Quantization)的核心思想?AWQ(Activation-aware Weight Quantization)的核心思想?
AWQ(Activation-aware Weight Quantization)认为:权重量化时不应一视同仁,而应根据激活的尺度对权重做保护。对激活幅值大的通道(或 group),对应权重更敏感,应少量化或用更高精度;对激活小的通道,权重可压得更狠。这样在相同比特预算下,重要通道保留更多信息,整体精度更好。
通过激活统计(如 calibration 时各 channel 的 scale 或重要性)得到一个 per-channel 的保护因子,在量化前对权重做 scaling:重要 channel 的权重放大(相当于量化时用更细的步长),不重要的缩小。量化后还原,或把 scale 融进后续的 linear 计算。可选地配合「混合精度」:少量关键 channel 保持 FP16/W8,其余 INT4,在显存与精度间折中。
GPTQ 是逐层基于 Hessian 的权重量化;SmoothQuant 是激活-权重的等价缩放迁移。AWQ 是按激活重要性对权重量化做非均匀保护,不改变前向数学形式,而是选「量化谁、压多少」,工程上常与 per-group 量化、KV cache 量化等一起用在大模型部署。
| 返回模块 | 返回总览 |