第 6 题:标签平滑(Label Smoothing)的贝叶斯解释,推荐场景中 ε 的最佳取值范围?
题目
标签平滑(Label Smoothing)的贝叶斯解释,推荐场景中ε的最佳取值范围?
完整讲解
一、做法
对 one-hot 标签 $\boldsymbol{y}$(如 $y_k=1$ 其余为 0),标签平滑改为
\(\tilde{y}_i = (1-\varepsilon) y_i + \frac{\varepsilon}{K},\quad \sum_i \tilde{y}_i = 1.\)
即正确类从 1 变为 $1-\varepsilon$,错误类从 0 变为 $\varepsilon/(K-1)$(或均匀 $\varepsilon/K$,两种写法略有不同,总和为 1 即可)。常用 $\varepsilon \in [0.05, 0.2]$。
二、贝叶斯解释
- 硬标签 相当于「正确类概率=1、其余=0」的信念,即认为标注绝对正确,没有不确定性。
- 软标签 相当于给标注一个先验不确定性:以概率 $1-\varepsilon$ 相信标注,以概率 $\varepsilon$ 均匀分给其他类;等价于在「标注」与「均匀先验」之间做插值。
- 从正则角度:软标签防止模型对正确类输出过度自信(logit 无穷大),使 logits 更平滑,校准更好,泛化往往更稳。
三、推荐场景中 ε 的取值
- 推荐/CTR:类别常为二分类或多类(如点击/未点击、多目标),样本不平衡、噪声较大。$\varepsilon$ 太小(如 0.01)几乎无效果;太大(如 0.3)会削弱正类信号,效果可能变差。
- 经验范围:多数工作用 0.1~0.2;0.1 最常用,稳定且有一定平滑与校准效果。在点击率等任务上可先试 0.1,再按验证集 AUC/校准曲线微调。
- 与噪声的关系:标注噪声大时可略大(如 0.15~0.2),相当于更不信「硬标签」;数据很干净时可略小(如 0.05~0.1)。
面试要点
- 能写出软标签形式 $(1-\varepsilon)y_i + \varepsilon/K$ 并说明总和为 1。
- 贝叶斯解释:在「相信标注」与「均匀先验」之间插值,相当于给标注加不确定性,起到正则与校准作用。
- 推荐场景:ε 常用 0.1~0.2,0.1 为默认起点;噪声大可略增。
记忆要点
- 软标签:$(1-\varepsilon)y_i + \varepsilon/K$;正确类 1→$1-\varepsilon$,其余 0→$\varepsilon/K$。
- 贝叶斯:标注不确定性先验,正则 + 校准,防过度自信。
- ε 推荐:0.1~0.2,默认 0.1;噪声大可略大。