第 228 题:大模型的推理加速,投机解码与量化压缩?
题目
大模型的推理加速,投机解码与量化压缩?
完整讲解
一、推理延迟与吞吐的瓶颈
- 自回归解码 step 间强依赖,单请求延迟高;大模型参数量大,单 token 计算与显存占用高。推理加速是落地关键。
二、投机解码(Speculative Decoding)
- 思路:用小模型或同一模型浅层快速生成若干「草稿」token,大模型一次前向对整段草稿做验证,接受连续正确前缀,从第一个错误处重写草稿,重复上述过程。
- 效果:在保持输出分布近似不变的前提下,用少量大模型步数完成更多 token,降低每 token 的 wall-clock 时间。
- 实现:草稿模型与主模型需 tokenizer 一致;batch 验证时对不同样本可能接受长度不同,需做 padding 或分桶。
三、量化与压缩
- 量化:权重量化到 int8/int4(如 GPTQ、AWQ),减少显存与带宽,推理加速;需校准或小样本补偿精度损失。
- 压缩:剪枝、知识蒸馏得到小模型,用 LoRA 等微调恢复部分能力;推荐场景可「大模型生成训练信号、小模型上线」做蒸馏。
- 工程:量化与投机可叠加;部署时用 vLLM、TensorRT-LLM 等做 kernel 优化与批处理。
面试要点
- 能说清投机解码的流程:小模型/草稿生成 → 大模型批量验证 → 接受前缀、从错误处重写。
- 能说明量化(int8/int4)、蒸馏、剪枝在推理加速中的作用,以及与投机解码的配合。
记忆要点
- 投机解码:草稿模型生成 → 大模型验证整段 → 接受连续正确前缀,减少大模型步数。
- 量化/压缩:int8/int4 降显存与带宽;蒸馏/剪枝得小模型;可与投机叠加,配合推理引擎优化。