ai-infra-interview-305

第 124 题:k-means量化和非均匀量化的应用场景?

题目

k-means量化和非均匀量化的应用场景?


完整讲解

一、K-means 量化

K-means 量化:把权重量化视为聚类问题,用 K 个中心(码本)表示权重,每个权重映射到最近中心,推理时用码本索引或查表计算。K=2^b 即 b-bit 量化。优点是可适应非均匀分布(中心由数据学出),在低比特下比均匀量化更准;缺点是推理需查表或额外解码,且码本更新(如微调)成本高,硬件上不如均匀 scale/zero_point 通用,多用于压缩、剪枝后的权重量化或研究。

二、非均匀量化

非均匀量化:量化步长不相等,在值密集区步长小、稀疏区步长大,从而在总比特数有限下更贴合分布、降低量化误差。实现方式包括:对数/指数刻度、K-means 码本、学习得到的 codebook 等。适合激活或权重分布明显非均匀、且有条件做校准或学习的场景;代价是推理时需非均匀查表或分段计算,通用 GPU 上不如均匀 INT8/INT4 高效,多用于专用芯片或极致压缩。

三、应用场景

K-means/非均匀量化常用于:极低比特(如 2~3 bit)权重量化、压缩优先的存储与传输、分布极不均匀的某一层或 channel;或与剪枝结合做「稀疏+非均匀量化」。生产推理更常用均匀 per-channel INT8/INT4 + 硬件友好 kernel;非均匀作为补充手段在特定场景使用。


面试要点


记忆要点

  1. K-means = 码本聚类量化,非均匀、低比特准,查表与硬件支持是瓶颈。
  2. 非均匀 = 不等步长,贴合分布;实现有对数/码本等。
  3. 应用:极低比特、压缩、特殊分布;生产多用均匀量化。
返回模块 返回总览