MiniLLM、DistilBERT?知识蒸馏在推理优化中的作用?MiniLLM、DistilBERT?
知识蒸馏用大模型(教师)的软标签或表示指导小模型(学生)训练,学生在相同或更低算力下逼近教师表现,从而在推理时用更小、更快的模型替代大模型,直接带来延迟与显存下降。因此蒸馏是「推理优化」的一种:不改变单次前向的量化或 kernel,而是用更小模型达到可接受精度,属于模型级优化。
DistilBERT:对 BERT 做蒸馏,学生层数/宽度更小,用教师 logits + 隐层 MSE 等损失训练,推理时参数量与计算量明显小于 BERT,适合资源受限部署。MiniLLM 等针对 LLM:用大 LLM 的生成分布(或 reward)蒸馏到小 LLM,减少幻觉、保持能力的同时缩小规模;可与量化、剪枝叠加,进一步加速推理。共同点:教师→学生、软标签/分布、小模型推理更快。
推理优化可组合:先蒸馏得到小模型,再对小模型做 INT8/INT4 量化或剪枝,进一步减显存与算力;或先量化大模型做「快但略逊」的基线,再用蒸馏小模型在同等延迟下追平/超越。面试可强调:蒸馏解决「模型规模」,量化/剪枝解决「单模型计算与存储」,三者互补。
| 返回模块 | 返回总览 |