第 232 题:大模型的对齐训练,RLHF在推荐偏好中的应用?
题目
大模型的对齐训练,RLHF在推荐偏好中的应用?
完整讲解
一、对齐与 RLHF 简述
- 对齐:使模型输出符合人类偏好(有用、无害、诚实等)。RLHF:用人类偏好标注训练奖励模型(RM),再用强化学习(如 PPO)最大化 RM 分,使策略模型与人类偏好一致。
二、在推荐偏好中的应用
- 偏好定义:推荐场景的偏好 = 用户更愿意点击/停留/转化的列表、更认可的理由、更自然的对话等;可用 A/B 或显式反馈得到 pairwise 偏好数据。
- 奖励建模:用 (query, 候选输出 A, 候选输出 B, 偏好 A>B) 训练 RM,对单条输出也可用标量反馈(点击、评分)构造隐式偏好。
- 策略优化:在推荐策略(生成列表/理由)上做 RL,以 RM 或业务指标(如 CTR 预估)为 reward,注意 reward hacking 与分布偏移,常用 KL 惩罚约束策略不要偏离初始模型太远。
- 替代方法:DPO 等无需显式 RM 的偏好优化也可用于推荐,数据格式仍为偏好对。
面试要点
- 能说清 RLHF 流程:偏好数据 → 奖励模型 → RL 优化策略,以及 KL 惩罚与分布偏移的注意点。
- 能说明推荐场景下偏好如何定义与采集(点击、转化、人工比较),以及 DPO 等替代方案。
记忆要点
- RLHF:偏好数据训 RM → RL 最大化 RM,策略加 KL 惩罚防偏移。
- 推荐偏好:点击/转化/人工比较定义偏好;RM 与策略可针对列表、理由、对话;可用 DPO 等无 RM 方法。