第 229 题:LLM与传统模型的级联,粗排过滤与精排生成?
题目
LLM与传统模型的级联,粗排过滤与精排生成?
完整讲解
一、级联的动机
- 成本与延迟:LLM 单次调用贵、慢,不适合对海量候选逐一打分。用传统模型(双塔、精排)做粗排/过滤,将候选从百万级压到百级,再用 LLM 做重排、生成理由或对话,兼顾效果与成本。
二、粗排过滤
- 粗排:双塔、内积检索、或轻量精排模型,用向量或简单特征快速筛出 top-K(如 500~2k),保证召回与多样性。
- 过滤规则:业务规则(下架、风控、已读)在粗排前或后统一过滤,减少无效候选进入 LLM。
三、精排与生成
- 精排:对粗排 top-K 用 LLM 做上下文感知的排序或打分,或只对 top-100 做 LLM 重排;输入为「用户上下文 + 候选列表」,输出排序或分数。
- 生成:在重排后的短列表上做理由生成、摘要、对话回复,此时候选少、可控性强。
- 级联设计要点:粗排召回率要足,否则 LLM 无法补救;LLM 层可设超时与降级,失败时回退到传统精排结果。
面试要点
- 能说清级联结构:传统粗排/检索压候选量 → LLM 精排或生成,以及为何这样设计(成本、延迟、效果)。
- 能说明粗排召回率的重要性、LLM 超时降级与回退策略。
记忆要点
- 级联:粗排(双塔/精排)把候选压到百级 → LLM 精排/理由生成;控成本与延迟。
- 要点:粗排保证召回,LLM 层超时降级回退传统精排。