结构化剪枝和非结构化剪枝的硬件友好性?
非结构化剪枝:按元素将权重置零,稀疏模式任意(每个位置独立)。可达到很高稀疏度且对精度友好(保留重要单权),但得到的稀疏矩阵在通用 GPU 上难以加速:常规 GEMM 和内存布局假设稠密或块稀疏,随机稀疏导致不规则访存与计算,实际加速比远低于理论零占比,甚至更慢。多用于压缩存储、与稀疏 kernel(需专用库或硬件)结合,或作为结构化剪枝的预处理。
结构化剪枝:按块剪枝,如整 channel、整 head、整块 N×M 为零。剪枝后仍为规整矩阵或更小的稠密块,硬件友好:可用标准 GEMM、减小 shape,真正减少 FLOPs 与带宽,推理加速明显。代价是自由度低,同稀疏度下精度通常不如非结构化;需在「结构约束」下做重要性估计与训练。
推理优化优先选结构化(channel/head 剪枝等),以便在现有框架与 GPU 上落地加速;非结构化适合存储压缩或配合专用稀疏硬件。也可「结构化+非结构化」:先做 channel 剪枝再对剩余权重做元素级稀疏,在支持稀疏算子的环境下进一步压缩。
| 返回模块 | 返回总览 |