第 17 题:数据增强在表格数据中的有效方法,Mixup/CutMix 如何适配推荐场景?
题目
数据增强在表格数据中的有效方法,Mixup/CutMix如何适配推荐场景?
完整讲解
一、表格数据中的增强
- 数值特征:加噪声(高斯)、缩放、分桶扰动;或按样本插值(类似 Mixup)。
- 类别特征:替换为同分布采样、或同 field 内随机其他 ID(需约束语义);dropout 部分特征。
- 序列特征:截断、打乱顺序、mask 部分行为、时间抖动。
- 行级:Mixup 在样本间做凸组合 $x’ = \lambda x_i + (1-\lambda)x_j$,$y’ = \lambda y_i + (1-\lambda)y_j$;对表格要区分数值(可插值)与类别(通常不直接插值,或只对 embedding 插值)。
二、Mixup 适配推荐
- 连续/Embedding 空间:在拼接后的稠密向量上做 Mixup(即对数值特征与 embedding 向量做 $\lambda x_i + (1-\lambda)x_j$),标签用 $\lambda y_i + (1-\lambda)y_j$(CTR 为软标签)。可提升泛化、平滑决策边界。
- 注意:ID 类特征不直接在离散空间 Mixup,而是先 embedding 再在向量空间 Mixup;或只对非 ID 部分 Mixup、ID 部分随机选其一。
三、CutMix 适配推荐
- CutMix 源自图像:裁剪一块区域、用另一张图同位置块替换。表格无「空间」概念,可类比为特征维度上的 mask:随机选一部分特征维度用样本 A、其余用样本 B,标签按比例混合。或对 embedding 的某些维度做「切块」混合。
- 推荐里更常见的是特征维度 dropout / 随机 mask(如随机丢弃部分 field),效果类似「部分用 A、部分用 B」的稀疏版,实现简单。
面试要点
- 表格增强:数值加噪/缩放;类别同分布替换或 dropout;序列截断/mask;行级 Mixup 在稠密/embedding 空间做。
- Mixup 推荐:对 concat 后的向量(或仅稠密+embedding)做插值,标签软标签;ID 不直接插值。
- CutMix:可类比为特征维 mask 或按维度混合;或简化为特征 dropout。
记忆要点
- 表格:数值噪声、类别替换/dropout、序列截断/mask;Mixup 在向量空间、软标签。
- 推荐 Mixup:embedding+稠密可插值;CutMix 可做特征维 mask。