对比学习中 InfoNCE Loss 与互信息下界的关系,负样本数 N→∞ 时的极限行为?
设有一个 query $\boldsymbol{q}$ 和一个正样本 $\boldsymbol{k}^+$(与 $\boldsymbol{q}$ 配对),以及 $N-1$ 个负样本 $\boldsymbol{k}_i^-$。记 $\tau$ 为温度,相似度用点积或余弦。InfoNCE 定义为 \(\mathcal{L} = -\ln \frac{\exp(\boldsymbol{q}^\top \boldsymbol{k}^+ / \tau)}{\exp(\boldsymbol{q}^\top \boldsymbol{k}^+ / \tau) + \sum_{i=1}^{N-1} \exp(\boldsymbol{q}^\top \boldsymbol{k}_i^- / \tau)}.\) 即把正样本相似度做 softmax 分子、正+负做分母,等价于 N 类分类「正确类为正样本」的交叉熵;因此也叫「N-way 分类」形式的对比损失。
记 $(\boldsymbol{q},\boldsymbol{k}^+)$ 为联合分布、$\boldsymbol{k}^-$ 为从边缘分布采样的负样本。可以证明:InfoNCE 是互信息 $I(\boldsymbol{q};\boldsymbol{k}^+)$ 的一个下界(在特定假设下)。
直观理解:最小化 InfoNCE ⇔ 让 $\boldsymbol{q}$ 与 $\boldsymbol{k}^+$ 的相似度相对负样本尽量大,即拉大正对与负对的 logits 差距,等价于让 $\boldsymbol{q}$ 与 $\boldsymbol{k}^+$ 的表示更「一致」、与无关负样本更「分离」,从而增加 $\boldsymbol{q}$ 与 $\boldsymbol{k}^+$ 之间的互信息。形式上有 \(I(\boldsymbol{q};\boldsymbol{k}^+) \geq \log N - \mathcal{L}_{\mathrm{InfoNCE}}.\) 因此 $\mathcal{L}_{\mathrm{InfoNCE}}$ 越小,互信息下界越高;对比学习是在最大化该下界,从而最大化互信息。
| N→∞ 的理论极限:在「负样本从真实边缘分布 i.i.d. 采样」的假设下,有工作证明 InfoNCE 随 N→∞ 趋近于 $-\ln \frac{p(\boldsymbol{k}^+ | \boldsymbol{q})}{p(\boldsymbol{k}^+)} + \mathrm{const}$ 等形式,与互信息更直接相关;即负样本越多,InfoNCE 越接近对互信息的更好估计,梯度估计也更准(负样本多,对比更充分)。 |
| 返回模块 | 返回总览 |