Focal Loss 的完整推导,γ=0 和 γ=2 时梯度形态的变化,何时会失效?
Focal Loss 用于类别不平衡(如检测中前景极少):普通交叉熵对「易分样本」($p_t$ 已很大)仍给不小梯度,易分样本数量多时总梯度被它们主导,难分样本(多为少数类)学不好。FL 通过对易分样本降权,让难分样本主导训练。
记 $p_t = p$(当 $y=1$)或 $1-p$(当 $y=0$),即真实类的概率。交叉熵为 $-\ln p_t$。Focal Loss 定义为 \(\mathrm{FL}(p_t) = -\alpha_t (1-p_t)^\gamma \ln p_t.\)
设二分类、$y=1$ 时 $p_t=p$,$y=0$ 时 $p_t=1-p$。统一写 $p_t$ 对 logit $z$ 的导数(sigmoid):$\frac{\partial p_t}{\partial z}$ 在 $y=1$ 时为 $p(1-p)$,在 $y=0$ 时为 $-p(1-p)$。为写梯度,令 $p_t = p$(正类),则 \(\mathrm{FL} = -\alpha (1-p)^\gamma \ln p,\quad \frac{\partial \mathrm{FL}}{\partial z} = \frac{\partial \mathrm{FL}}{\partial p}\cdot \frac{\partial p}{\partial z}.\) \(\frac{\partial \mathrm{FL}}{\partial p} = -\alpha \left[ -\gamma(1-p)^{\gamma-1}\ln p + (1-p)^\gamma \frac{1}{p} \right] = \alpha (1-p)^{\gamma-1}\left( \gamma \ln p + \frac{1-p}{p} \right).\) 结合 $\frac{\partial p}{\partial z} = p(1-p)$ 可得对 $z$ 的梯度;形式中含 $(1-p)^{\gamma-1}$ 与 $p$ 的因子。
关键:相对普通交叉熵的梯度 $p-y$,FL 多了一个因子 $\propto (1-p_t)^\gamma$(以及一项与 $\gamma$ 有关的项)。$p_t$ 大时该因子小,易分样本梯度被压制;$p_t$ 小时梯度保留,难分样本主导更新。
| 返回模块 | 返回总览 |