第 245 题:大模型的偏见放大,训练数据的代表性问题?
题目
大模型的偏见放大,训练数据的代表性问题?
完整讲解
一、偏见放大的含义
- 偏见:训练数据中存在的统计偏差(如某群体/品类过表征、历史歧视性策略导致的反馈偏差)。大模型会记忆并放大这些模式,推荐时可能加剧不公平或刻板印象。
二、训练数据的代表性问题
- 代表不足:少数群体、长尾品类、新用户/新 item 在数据中样本少,模型学到的分布偏多数,推荐时对少数不利(准确率低、曝光少)。
- 反馈偏差:点击/转化受历史曝光与位置影响,并非真实偏好;若直接当标签训练,会强化「马太效应」与流行偏差,放大已有偏见。
- 文本与行为:若用含偏见表述的文本(如刻板化描述)做预训练或指令数据,模型可能生成或推荐带偏见的理由与结果。
三、缓解方向
- 数据:平衡采样、去偏重加权、合成少数样本;清洗偏见表述、多样化指令与示例。
- 目标与评估:加入公平性约束或正则、多目标优化;评估时按群体/品类分层,监控曝光与满意度差异。
- 推理与策略:配额、探索、公平性约束排序;拒绝生成歧视性理由,结合安全对齐。
面试要点
- 能说清偏见放大的原因:数据代表不足、反馈偏差、文本偏见被模型学习并放大。
- 能列举缓解手段:数据平衡与去偏、公平性目标与评估、推理侧配额与约束。
记忆要点
- 偏见放大:数据代表不足与反馈偏差被模型学习并放大;少数群体与长尾易受损。
- 缓解:数据平衡与去偏、公平性目标与分层评估、推理配额与安全约束。