第 234 题:多智能体推荐,LLM作为用户模拟器?
题目
多智能体推荐,LLM作为用户模拟器?
完整讲解
一、多智能体与用户模拟
- 多智能体:多个 LLM 或模型分别扮演不同角色(用户、推荐系统、评论者等),通过多轮交互完成评估、辩论或数据生成。
- 用户模拟器:用 LLM 扮演「用户」,根据画像与历史,对给定推荐列表或追问做出拟人反应(点击、跳过、追问、负反馈),用于离线评估、对话数据生成或对抗训练。
二、在推荐中的应用
- 评估:用户智能体对推荐结果做拟真反馈,可算满意度、追问率等,弥补无真实用户的离线评估。
- 数据生成:用户与推荐系统多轮对话,生成 (state, action, response) 数据,用于训对话推荐或 RL。
- 对抗/鲁棒:用户智能体模拟难缠或边界行为,提升推荐系统在澄清、拒绝、多兴趣切换上的鲁棒性。
- 设计要点:用户模拟器需有明确的状态与偏好设定,避免过于随机;多智能体需约定协议与格式,便于解析与评估。
面试要点
- 能说清多智能体推荐中「LLM 作为用户模拟器」的用途:评估、数据生成、对抗训练。
- 能说明用户模拟器的状态与偏好设定、多轮协议,以及如何保证拟真与可控。
记忆要点
- 多智能体推荐:多 LLM 扮演用户/系统等;用户模拟器拟人反应,用于评估、数据生成、鲁棒训练。
- 要点:明确用户状态与偏好、约定协议与格式,平衡拟真与可控。