第 238 题:实时大模型推荐,流式上下文更新机制?
题目
实时大模型推荐,流式上下文更新机制?
完整讲解
一、实时大模型推荐的挑战
- 用户兴趣随最近行为快速变化;若上下文在请求时才固定,流式行为(正在看的、刚点赞的)需能及时进入上下文,否则推荐滞后。
二、流式上下文更新机制
- 事件流:用户行为(点击、播放、搜索)以事件流写入消息队列或流存储,推荐服务消费流并维护「用户最新上下文」的缓存或状态。
- 上下文组装:每次推荐请求时,从缓存/状态中取最近 N 条或最近 T 秒的行为,与画像、长期兴趣拼接成 Prompt 或特征;可设滑动窗口或基于时间的衰减。
- 与 LLM 的衔接:上下文更新后重新构造 Prompt 或重算与候选的匹配;若用向量检索,可对最近行为做实时 embedding 并更新用户向量,再与候选检索。
- 一致性:多实例部署时需保证同一用户的上下文在路由到的实例上一致,可通过集中式状态或 sticky 路由解决。
面试要点
- 能说清流式上下文更新:行为事件流 → 实时聚合/缓存 → 请求时取最近窗口拼入 Prompt 或特征。
- 能说明与 LLM/检索的衔接、多实例下上下文一致性与延迟权衡。
记忆要点
- 实时大模型推荐:行为流式写入,服务端维护最新上下文缓存,请求时取最近窗口拼入输入。
- 衔接:Prompt 或向量实时更新;多实例需集中状态或 sticky 保证一致。