第 141 题:位置偏置的建模,位置作为特征的暴露风险?
题目
位置偏置的建模,位置作为特征的暴露风险?
完整讲解
一、位置偏置与曝光
位置偏置:同一 item 在不同展示位置(如 1 位、10 位)被点击的概率不同,高位通常点击率更高,部分来自用户真实偏好,部分来自曝光与注意力(用户更易看到前几位)。若模型把「位置」当普通特征学,会学到「位置越前点击越高」,导致排序时倾向于把预测点击高的 item 放前面,而预测高可能来自「位置好」而非「内容好」,形成曝光与反馈的循环,评估与公平性失真。
二、位置作为特征的暴露风险
- 风险:模型学到「位置→点击」的强相关后,线上排序会倾向于给「历史占高位」的 item 继续高位,马太效应;且离线评估时若用带位置的样本,高位置样本权重大,指标易虚高;A/B 时位置策略变化会干扰模型效果归因。
- 本质:位置是混杂因素(confounder)——既影响曝光又影响点击,直接当特征会让模型混淆「因位置而点击」与「因偏好而点击」。
三、缓解思路
- 不把位置当输入特征:排序阶段不用位置,仅用内容与用户特征;位置在展示层单独控制(如随机化、轮播),再通过无偏估计(IPW、PAL 等)从带偏的日志中学习。
- 位置偏置建模与消偏:显式建模「位置→点击」的偏置项(如位置嵌入或标量),训练时用该偏置做纠偏(如 IPS 加权、或 PAL 联合训练偏置与主模型),推理时固定/去掉偏置项,使主模型学的是「去位置后的偏好」。
- 评估:用随机位置数据或留出位置做无偏评估;或报告「按位置分层」的指标,避免位置主导结论。
面试要点
- 能说明位置偏置的来源(曝光、注意力)及「位置当特征」会学到位置→点击、导致循环与评估失真。
- 能说清暴露风险:马太效应、离线指标虚高、位置为混杂因素。
- 能列举缓解:不用位置当排序特征、偏置建模与消偏(PAL/IPW)、无偏评估与分层指标。
记忆要点
- 位置偏置:高位点击高部分来自曝光/注意力;位置当特征→模型学位置→曝光循环、评估失真。
- 风险:马太效应、指标虚高、位置为混杂因素。
- 缓解:排序不用位置、偏置建模与消偏(PAL/IPW)、无偏评估。