第 30 题:离线-在线指标不一致的根因分析,特征分布偏移 vs 选择偏置?
题目
离线-在线指标不一致的根因分析,特征分布偏移 vs 选择偏置?
完整讲解
一、现象
离线 AUC/GAUC 提升,上线后点击率、转化、收入无提升甚至下降——离线-在线不一致。
二、特征分布偏移(Distribution Shift)
- 定义:线上请求的特征分布与离线训练数据不同(如新用户增多、季节与活动、策略与产品改动导致曝光分布变)。
- 影响:模型在「没见过的分布」上泛化差;校准与排序都可能变差。
- 应对:用近期在线或全量日志训;领域自适应/重加权;在线学习或定期更新;监控特征与预测分布。
三、选择偏置(Selection Bias)
- 定义:离线数据是之前策略筛选后的结果——只有被曝光、被点击的才有样本;未曝光或未点击的 item/用户 underrepresented,即数据非随机、受历史策略影响。
- 影响:模型学到「历史策略的偏好」而非「真实用户偏好」;离线指标高可能只是拟合了选择机制,线上换策略后分布变,效果变差。
- 应对:因果纠偏(IPW、DR)、反事实评估、使用无偏或低偏的评估集(如随机探索数据);在训练中显式建模曝光/选择。
四、对比与综合
- 分布偏移:强调 P(X) 或 P(X,Y) 变了,环境与数据来源变了。
- 选择偏置:强调 数据是谁被选进来的,历史策略导致样本不具代表性。
- 实践中两者常并存:既有分布随时间的偏移,也有历史策略的选择偏置。排查时可先看特征与标签分布(偏移),再看曝光/点击与随机探索比例(选择);再结合 A/B、Interleaving 与无偏评估设计验证。
面试要点
- 分布偏移:线上特征/联合分布与训练不同;应对用近期数据、自适应、监控。
- 选择偏置:离线数据受历史策略筛选,非随机;应对用 IPW、反事实、随机探索数据。
- 两者可并存;排查时先看分布、再看选择与探索。
记忆要点
- 偏移 = 分布变了;选择偏置 = 数据被策略筛选。
- 应对:偏移→近期数据/自适应;选择→IPW、反事实、探索数据。