第 230 题:大模型的评估,人工评估与自动指标的对齐?
题目
大模型的评估,人工评估与自动指标的对齐?
完整讲解
一、大模型评估的难点
- 推荐输出多样(排序、列表、理由、对话),单一自动指标难以全面衡量;人类对「相关性、有用性、安全」的判断与自动指标未必一致,需人工评估与自动指标对齐。
二、人工评估
- 维度:相关性、多样性、新颖性、理由质量、事实性、无害性等;可设计打分表与示例,做校准与一致性培训。
- 流程:抽样 → 多人标注 → 一致性检验(如 Kappa);可做 A/B 与基线对比,或 pairwise 偏好标注供 RLHF/DPO。
- 成本:人工贵且慢,通常用于关键场景、上线前验收与定期抽检,并用于构造自动指标的标注集。
三、自动指标与对齐
- 自动指标:NDCG、MRR、多样性指标、理由的 BLEU/ROUGE、事实性(与知识库匹配)、安全分类器分数等。
- 对齐:用人工标注数据训练/调参,使自动指标与人工偏好相关(如学习 to rank、偏好模型);定期用人工抽检校验自动指标是否漂移。
- 推荐专用:可定义「推荐满意度」「转化相关性」等业务指标,与人工标签回归或分层评估。
面试要点
- 能说清大模型推荐评估为何需要人工+自动:人工多维度、自动可规模化,二者需对齐与校验。
- 能列举常用自动指标(NDCG、理由质量、事实性)及与人工对齐的方法(标注、偏好学习、抽检)。
记忆要点
- 评估:人工多维度(相关、多样、理由、事实、安全),自动指标可规模化;二者需对齐与定期校验。
- 对齐:用人工标注训/调自动指标或偏好模型;业务指标与人工分层评估。