第 152 题:观看时长预测,加权Logistic回归 vs 分位数回归?
题目
观看时长预测,加权Logistic回归 vs 分位数回归?
完整讲解
一、观看时长预测的目标
观看时长(watch time、完播率)是视频与信息流的重要目标。可直接回归时长(如 MSE),但时长分布长尾、非负、偏态,回归易被极端值主导。常用两种替代方式:加权 Logistic 回归(将时长转为二分类或分段+权重)与分位数回归(预测时长的分位数而非均值)。
二、加权 Logistic 回归
- 做法:将「是否观看超过某阈值 $T$」视为二分类(如 $y = \mathbb{1}[\text{duration} \ge T]$),用 Logistic 回归拟合 $P(y=1 \mid x)$。为让预测概率与时长单调相关,可用时长作为样本权重:样本权重 $w_i = \text{duration}_i$(或 $\min(\text{duration}_i, cap)$ 截断),loss 为 $w_i \cdot \text{BCE}(y_i, \hat{p}_i)$。这样「看更久」的样本对梯度贡献更大,学到的概率在期望意义下与时长正相关,可近似作为「期望观看时长」的代理。
- 优点:实现简单、与 CTR 框架一致(二分类+权重);多阈值可得多档位概率。
- 缺点:本质是分类、非直接回归时长;权重设计(截断、归一化)需调。
三、分位数回归
- 做法:不预测均值 $\mathbb{E}[\text{duration}]$,而预测分位数 $q_\tau$(如中位数 $\tau=0.5$、90 分位 $\tau=0.9$)。损失为 pinball loss:
\(\rho_\tau(u) = \tau \cdot \max(u,0) + (1-\tau) \cdot \max(-u,0),\quad u = y - \hat{q}_\tau.\)
最小化 $\sum_i \rho_\tau(y_i - \hat{q}_\tau(x_i))$ 得到 $\tau$ 分位数的估计。可同时预测多个 $\tau$(如 0.5, 0.7, 0.9)得到分布刻画。
- 优点:对长尾与异常值鲁棒;可得到分布而非仅均值,便于做风险或多样性决策。
- 缺点:多分位数则多输出、参数与计算略增;与「点击式」的排序框架需结合(如用某分位数或期望作为分数)。
四、选型与结合
- 排序主用、需与点击融合:加权 Logistic 更易与 CTR 多任务或分数量纲统一(概率×时长权重)。
- 需分布、抗长尾:分位数回归;或加权 Logistic 多阈值 + 拟合期望时长曲线。
- 实践中可多任务:一路 CTR、一路加权时长分类或分位数回归,再融合分数。
面试要点
- 能说明观看时长预测的难点(长尾、偏态)及加权 Logistic(时长作权重、二分类)与分位数回归(pinball loss、预测分位数)的做法。
- 能说清加权 Logistic 的动机(概率与时长单调、梯度与时长正相关);分位数回归的鲁棒性与分布刻画。
- 能对比选型:排序融合用加权 Logistic、要分布用分位数;可多任务结合。
记忆要点
- 加权 Logistic:二分类(是否超阈值)+ 样本权重=时长,使概率与时长单调相关。
- 分位数回归:pinball loss、预测 $q_\tau$;鲁棒、得分布;多 $\tau$ 可得多分位。
- 排序融合常用加权 Logistic;要分布/抗长尾用分位数;可多任务。