第 236 题:设计一个支持10万QPS的大模型推理服务?
题目
设计一个支持10万QPS的大模型推理服务?
完整讲解
一、10 万 QPS 的挑战
高 QPS 要求 高吞吐、低延迟、可扩展、高可用。单实例 GPU 推理有限(数千 QPS 量级);需 水平扩展:多实例 + 负载均衡、自动扩缩容、批处理与动态 batching 提高单卡吞吐,以及 缓存、限流、降级 保护与成本控制。
二、核心组件
网关与路由:负载均衡(L4/L7)把请求分到多实例;路由 按模型/版本、canary 等;限流与熔断 防过载。推理服务:多副本 无状态;动态 batching(vLLM、Triton 等)聚多请求为一 batch 提高 GPU 利用率;连续批处理(continuous batching)流式场景下边生成边输出。扩缩容:HPA/KEDA 按 QPS、队列、延迟扩缩;预热 与 冷却 避免抖动。可观测:延迟(P50/P99)、QPS、错误率 监控与告警;trace 做请求级排查。
三、存储、缓存与成本
模型:从 模型仓库 拉取或 挂载;大模型可 多副本加载 或 按需加载。缓存:结果缓存(相同 prompt 直接返回)、KV cache 复用(vLLM 等);降低重复计算与延迟。成本:10 万 QPS 需 数十到数百 GPU 实例;Spot、混部、批处理 与 缓存 控成本;多 region 做就近与容灾。
面试要点
- 10 万 QPS:水平扩展 + 负载均衡、动态/连续 batching、扩缩容、限流与熔断。
- 推理服务多副本、动态 batch;HPA/KEDA + 预热;延迟/QPS/错误率监控与 trace。
- 模型仓库、结果与 KV 缓存;Spot/混部/多 region 控成本。
记忆要点
- 高 QPS = 多实例 + LB + 批处理 + 扩缩容。
- 动态/连续 batching;HPA/KEDA;可观测。
- 缓存、限流、成本控制。