第 71 题:知识蒸馏的温度系数,软标签熵与蒸馏效果的关系?
题目
知识蒸馏的温度系数,软标签熵与蒸馏效果的关系?
完整讲解
一、知识蒸馏与软标签
知识蒸馏用教师模型(大模型)的软输出作为学生模型(小模型)的监督。设教师 logits 为 $\boldsymbol{z}^T$,学生为 $\boldsymbol{z}^S$,软标签为 softmax 后的概率分布 $\boldsymbol{p}^T,\ \boldsymbol{p}^S$。蒸馏损失常用 KL 散度:
\(\mathcal{L}_{KD} = \text{KL}(\boldsymbol{p}^S \| \boldsymbol{p}^T) = \sum_i p_i^T \ln \frac{p_i^T}{p_i^S}.\)
二、温度系数与软标签熵
引入温度 $T$,将 logits 缩放后再做 softmax:
\(p_i = \frac{\exp(z_i / T)}{\sum_j \exp(z_j / T)}.\)
- $T=1$:即标准 softmax,分布通常较尖锐(高置信度),熵小。
- $T>1$:分布变「软」,概率更均匀,熵增大;软标签携带更多类间相对关系(dark knowledge),例如「像猫又略像狗」的信息,学生可从这些相对关系中学到更多,而不只学硬标签。
- $T$ 过大:分布趋近均匀,信息量下降,蒸馏信号变弱;$T$ 过小则趋硬标签,蒸馏优势丧失。通常 $T \in [2, 10]$ 经验有效。
三、蒸馏效果与温度选择
- 软标签熵适中时,学生既能学到类间相对强度,又不过于平滑;中等温度(如 $T=4$)常作为起点。
- 与硬标签联合训练时:$\mathcal{L} = \alpha \mathcal{L}{hard} + (1-\alpha) T^2 \mathcal{L}{KD}$,$T^2$ 可补偿温度对 KL 梯度量级的影响。温度需与 $\alpha$ 一起调参。
面试要点
- 能写出带温度的 softmax:$p_i = \exp(z_i/T) / \sum_j \exp(z_j/T)$;$T>1$ 使分布变软、熵增,携带 dark knowledge。
- 能说明温度与蒸馏效果:适中 $T$ 软标签信息丰富;$T$ 过大趋均匀、过小趋硬标签;常取 $T\in[2,10]$,与 $T^2$ 加权配合。
- 能提及 KL 蒸馏损失、与硬标签联合训练时的 $\alpha$ 与 $T^2$ 补偿。
记忆要点
- 温度 $T$:$p_i \propto \exp(z_i/T)$;$T>1$ → 软、熵大、dark knowledge 多。
- 效果:适中 $T$ 最佳;过大过小均不利;$T^2$ 补偿 KL 量级。
- 实践:$T\in[2,10]$,与硬标签联合时调 $\alpha$ 与 $T$。