第 79 题:特征选择门控,L0正则化的稀疏诱导与优化技巧?
题目
特征选择门控,L0正则化的稀疏诱导与优化技巧?
完整讲解
一、L0 正则与稀疏诱导
L0 正则:$|\theta|_0$ 为参数中非零个数,最小化「损失 + $\lambda |\theta|_0$」会直接得到稀疏解(部分参数为 0),实现特征选择或结构剪枝。但 L0 非连续、非凸,优化困难。
二、L0 的连续松弛与优化技巧
- 连续松弛:用可微的门控变量近似 L0。例如对每维参数引入 $z \in [0,1]$,输出为 $\theta \cdot z$,并约束 $z$ 的期望或和接近 0 的个数。常用 Hard Concrete / L0 门控:$z = \sigma((\log u - \log(1-u) + \log \alpha) / \beta)$,$u \sim \text{Uniform}(0,1)$,$\alpha$ 可学习,$\beta$ 为温度;训练时对 $z$ 采样或用直通估计,使 $\sum z$ 近似「非零数」,可微优化。
- 稀疏诱导:损失中加入对 $\alpha$ 或 $E[z]$ 的正则(如鼓励 $\alpha$ 变小),优化后部分 $z \approx 0$,对应特征或神经元被关闭,实现可学习的特征/结构选择。
- 优化技巧:温度 $\beta$ 从大往小退火,使 $z$ 从软变硬;或用 STE 将 $z$ 的梯度回传到 $\alpha$;初始化与 $\lambda$ 需调,以平衡稀疏度与任务损失。
三、在推荐中的应用
- 特征选择:对大规模特征做 L0 门控,自动筛掉冗余或噪声特征,减小嵌入与计算。
- 结构稀疏:对专家、通道或注意力头做 L0,得到更小或更稀疏的子网络。与 NAS、剪枝结合可进一步压缩。
面试要点
- 能说明 L0:$|\theta|_0$ 非零数,最小化可获稀疏解;L0 非凸难优化,需连续松弛。
- 能解释门控松弛:用 Hard Concrete 等可微门控 $z$,$\theta\cdot z$ 与对 $z$ 的稀疏正则,可学习地关掉部分参数/特征。
- 能提及温度退火、STE、特征选择与结构稀疏在推荐中的用途。
记忆要点
- L0:非零数,稀疏但难优化;用可微门控(如 Hard Concrete)松弛。
- 门控 $z$ + 稀疏正则 → 可学习特征/结构选择;温度退火、STE。
- 推荐:特征选择、专家/通道稀疏。