第 19 题:知识蒸馏中软标签与硬标签的权重分配,温度与软标签熵的关系?
题目
知识蒸馏中软标签与硬标签的权重分配,温度与软标签熵的关系?
完整讲解
一、软标签与硬标签
- 硬标签:one-hot,正确类 1、其余 0;信息少,只告诉「哪个类」。
- 软标签:教师 softmax 输出(常带温度 $T$),$q_i = \exp(z_i/T)/\sum_j \exp(z_j/T)$;含类间相对关系(dark knowledge),如「与正确类相近的类概率略高」。
二、温度与软标签熵
- $T=1$:教师原始 logits,分布通常较尖,熵小。
- $T>1$:分布变平滑,熵增大;类间差异被压缩,相对大小仍保留,学生更容易学到「谁比谁略好」。
- $T$ 过大:分布趋近均匀,熵很大但信息量下降,蒸馏信号弱。通常 $T \in [2,10]$,$T=4$ 常见。
三、软硬标签的权重分配
-
| 总损失常写为:$\mathcal{L} = \alpha \mathcal{L}{\mathrm{soft}} + (1-\alpha) \mathcal{L}{\mathrm{hard}}$。$\mathcal{L}_{\mathrm{soft}}$ 用 KL(学生 |
|
教师) 或 CE(学生, 教师软标签);$\mathcal{L}_{\mathrm{hard}}$ 用 CE(学生, 真实标签)。 |
- $\alpha$ 大:更依赖教师,适合教师很强、学生容量小;$\alpha$ 小:更依赖真实标签,适合教师一般或数据噪声小。
- 实践:可先 $\alpha=0.5\sim0.7$,再按验证集调;或两阶段:先主要用软标签训,后期加大硬标签权重做校准。
面试要点
- 温度 $T>1$ 使软标签更平滑、熵增大,保留相对关系;$T$ 过大则趋均匀、信息弱。
- 软硬权重 $\alpha$:软标签传 dark knowledge,硬标签保正确类;$\alpha$ 按教师强弱与阶段调。
记忆要点
- $T$ 大 → 软标签熵大、更平滑;常用 $T=2\sim10$。
- 损失 $\alpha \mathcal{L}{\mathrm{soft}} + (1-\alpha)\mathcal{L}{\mathrm{hard}}$;$\alpha$ 按教师与阶段调。