第 157 题:长期价值预测,强化学习的价值函数近似?
题目
长期价值预测,强化学习的价值函数近似?
完整讲解
一、长期价值预测
长期价值(LTV、用户生命周期价值、长期回报)不仅依赖当前点击/转化,还依赖未来的留存、复购、时长等。单步模型(如 CTR)只预测即时反馈;长期价值需对「未来多步累积回报」做预测,与强化学习(RL)中的价值函数概念一致。
二、强化学习中的价值函数
- 状态价值 $V^\pi(s) = \mathbb{E}\pi\big[\sum{t \ge 0} \gamma^t r_t \mid s_0 = s\big]$:从状态 $s$ 出发、按策略 $\pi$ 的累积折扣回报。动作价值 $Q^\pi(s,a) = \mathbb{E}\pi\big[\sum{t \ge 0} \gamma^t r_t \mid s_0=s, a_0=a\big]$。长期价值即 $V$ 或 $Q$ 的某种形式(如以「用户状态」为 $s$、「推荐动作」为 $a$、$r$ 为即时收益)。
- 贝尔曼方程:$V^\pi(s) = \mathbb{E}_{a,s’}[r + \gamma V^\pi(s’)]$,$Q^\pi(s,a) = \mathbb{E}[r + \gamma Q^\pi(s’,a’)]$,即价值函数的递归形式,便于用函数近似(如 DNN)拟合。
三、价值函数近似
- 表格式 $V(s)$ 在状态空间大时不可行,用函数近似 $V(s; \theta)$ 或 $Q(s,a; \theta)$,参数 $\theta$ 由数据或与环境交互学习。拟合目标:最小化 TD 误差 $\big(r + \gamma \hat{V}(s’) - \hat{V}(s)\big)^2$ 或类似,使估计满足贝尔曼方程。
- 在推荐中:状态 $s$ 可为用户特征与上下文,动作 $a$ 为推荐 item 或 slate;奖励 $r$ 为点击、时长、转化等。学 $Q(s,a)$ 即学「在该状态下推该 item 的长期价值」,用于排序或探索。长期通过 $\gamma$ 体现:$\gamma$ 接近 1 则更重视远期回报。
- 挑战:离线数据非策略、探索不足时 Q 估计有偏;状态与动作空间大,需泛化好的近似(DNN);奖励稀疏与延迟(转化滞后)需建模。
四、与短期模型的关系
- 短期 CTR/CVR 可看作 $\gamma=0$ 或只取即时 $r$ 的特例;长期价值 = 多步累积,RL 价值函数给出统一框架。
- 实践可多任务:一路短期 CTR、一路价值近似 $Q$,融合分数或约束(如选 Q 高且 CTR 不过低的 item)。
面试要点
- 能说明长期价值=多步累积回报,与 RL 价值函数 $V/Q$ 一致;贝尔曼方程与折扣 $\gamma$。
- 能说清价值函数近似:用 DNN 拟合 $Q(s,a)$、TD 目标、在推荐中状态/动作/奖励的定义。
- 能提及离线偏差、探索、奖励延迟与多任务结合短期模型。
记忆要点
- 长期价值≈$V^\pi(s)$ 或 $Q^\pi(s,a)$;贝尔曼方程递归、用 DNN 近似。
- 推荐中 $s$=用户/上下文,$a$=item,$r$=点击/转化;学 $Q$ 做长期排序。
- 挑战:离线偏差、探索、奖励延迟;可与短期 CTR 多任务融合。