第 239 题:大模型的安全对齐,有害推荐的拒绝生成?
题目
大模型的安全对齐,有害推荐的拒绝生成?
完整讲解
一、安全对齐与有害推荐
- 对齐目标:模型不生成违法、违规、歧视、诱导成瘾等有害内容。在推荐场景即拒绝生成或推荐有害 item、理由或对话,并在边界情况下明确拒绝而非迎合。
二、拒绝生成的实现
- 训练阶段:在指令数据中加入「不应推荐」的示例(违禁、不适龄、虚假宣传等),教模型输出拒绝话术或空列表;结合 RLHF/DPO 对「正确拒绝」给予正向偏好。
- 推理阶段:系统 Prompt 中明确禁止类别与拒绝格式;对模型输出做安全分类器或规则校验,若检测到有害则替换为拒绝话术或降级到安全兜底。
- 推荐侧:候选在入库与召回阶段做安全过滤,LLM 仅对已过审候选做排序/理由生成;若用户 query 敏感,可拒绝推荐并提示修改意图。
- 持续迭代:收集边界与对抗样本,更新规则与模型,做红队测试与审计。
面试要点
- 能说清安全对齐在推荐中的体现:拒绝有害推荐与有害生成,训练与推理双端约束。
- 能说明拒绝生成的实现(指令数据、RLHF、安全分类器、候选过滤)与迭代方式。
记忆要点
- 安全对齐:拒绝生成/推荐有害内容;训练加拒绝示例与偏好,推理加规则与安全分类器。
- 推荐侧:候选先过审再进 LLM;敏感 query 可拒绝并提示。