第 142 题:位置偏置的消除,PAL(Position Bias Aware Learning)的联合训练?
题目
位置偏置的消除,PAL(Position Bias Aware Learning)的联合训练?
完整讲解
一、位置偏置与消偏目标
点击受位置偏置影响:$P(\text{click} \mid x, pos)$ 可分解为「用户对 item $x$ 的偏好」与「位置 $pos$ 带来的曝光/注意力」。消偏目标是学得与位置无关的偏好模型,使排序依据真实偏好而非「占位好」。PAL(Position bias Aware Learning) 通过联合训练主模型与位置偏置项,在训练阶段显式建模偏置,推理时去掉偏置,得到无偏偏好估计。
二、PAL 的联合训练形式
- 模型分解:假设
\(P(\text{click} \mid x, pos) \approx P(\text{rel} \mid x) \cdot P(\text{exam} \mid pos),\)
即点击 = 相关性(偏好)× 检验概率(位置导致的曝光/点击概率)。或采用加法/对数空间形式:$\log p = f_\theta(x) + g_\phi(pos)$,$f$ 为主模型、$g$ 为位置偏置项。
- 联合训练:主模型 $f_\theta$(user、item、上下文,不含位置)与位置项 $g_\phi(pos)$ 一起用点击数据训练,损失为交叉熵等。数据中同一 item 出现在不同位置时,$g(pos)$ 会学到「位置效应」,$f$ 会学到「去位置后的偏好」。
- 推理:线上排序只用 $f_\theta(x)$,不用 $g_\phi(pos)$,即消除位置偏置,排序完全基于学到的偏好。
三、实现要点
- ** identifiability:需保证「偏好」与「位置」可区分。若所有样本同一位置则无法分离;需有同一 item 多位置或随机化位置**的日志,才能从数据中识别 $f$ 与 $g$。
- 正则与约束:可对 $g$ 加单调约束(高位 exam 不低于低位)或先验,避免 $g$ 抢走主模型信号。
- 与 IPW 的关系:PAL 是模型内消偏;IPW 是样本加权(权重为 1/倾向分)从带偏数据中估计无偏损失。二者可结合:用 PAL 估计倾向分再做 IPW,或仅用 PAL 联合训练。
四、工程建议
- 训练数据需含多位置曝光;若业务有随机化位置流量,优先用该部分训 PAL。
- 评估时用无偏集(随机位置或留出位置)看主模型 $f$ 的排序质量。
面试要点
- 能说明 PAL 的分解:点击≈偏好×位置检验概率,联合训练 $f$(主模型)+ $g$(位置偏置)。
- 能说清推理时只用 $f$、不用 $g$,即消偏;需数据中同一 item 多位置或随机位置以识别 $f$ 与 $g$。
- 能提及 identifiability、对 $g$ 的约束、与 IPW 的关系。
记忆要点
- PAL:点击=偏好×位置;联合训 $f$(无位置)+ $g(pos)$;推理用 $f$ 消偏。
- 需多位置/随机位置数据才能识别 $f$ 与 $g$;可对 $g$ 加单调等约束。
- 与 IPW 可结合;评估用无偏集。