第 240 题:大模型的成本优化,蒸馏与小模型的能力迁移?
题目
大模型的成本优化,蒸馏与小模型的能力迁移?
完整讲解
一、成本优化的动机
- 大模型推理与训练成本高;蒸馏与小模型能力迁移可在保持大部分效果的前提下显著降本、降延迟。
二、蒸馏
- 逻辑蒸馏:用大模型在无标签或弱标签数据上生成软标签(概率分布)或排序信号,小模型(同构或异构)在相同输入上拟合大模型输出,损失常用 KL 或 listwise ranking loss。
- 特征蒸馏:小模型中间层或输出层对齐大模型对应层的表示,增强小模型表示能力。
- 推荐场景:大模型做重排/理由生成的 logits 或排序对作为教师,小模型(双塔、精排、小 LLM)学习模仿,上线时仅部署小模型。
三、能力迁移与小模型
- 迁移内容:排序偏好、理由风格、对话策略等;通过蒸馏、数据复用(大模型标注的数据训小模型)或课程学习迁移。
- 小模型选择:小尺寸 LLM、传统精排/双塔 + 文本编码器,按延迟与效果做权衡;可多阶段(小模型粗排 + 大模型仅对 top 精排)进一步控成本。
- 持续更新:大模型迭代后重新蒸馏或增量蒸馏,使小模型跟踪大模型能力。
面试要点
- 能说清蒸馏流程:大模型生成软标签/排序 → 小模型拟合;特征蒸馏与逻辑蒸馏的区别。
- 能说明推荐场景下如何用蒸馏做重排/理由迁移、小模型选型与多阶段部署。
记忆要点
- 成本优化:蒸馏(逻辑/特征)把大模型能力迁到小模型;推荐上可迁排序、理由、对话。
- 小模型上线、大模型作教师;可多阶段(小模型粗排+大模型精排)与持续再蒸馏。