ai-infra-interview-305

第 236 题:设计一个支持10万QPS的大模型推理服务?

题目

设计一个支持10万QPS的大模型推理服务?


完整讲解

一、10 万 QPS 的挑战

高 QPS 要求 高吞吐、低延迟、可扩展、高可用。单实例 GPU 推理有限(数千 QPS 量级);需 水平扩展:多实例 + 负载均衡自动扩缩容批处理与动态 batching 提高单卡吞吐,以及 缓存、限流、降级 保护与成本控制。

二、核心组件

网关与路由负载均衡(L4/L7)把请求分到多实例;路由 按模型/版本、canary 等;限流与熔断 防过载。推理服务多副本 无状态;动态 batching(vLLM、Triton 等)聚多请求为一 batch 提高 GPU 利用率;连续批处理(continuous batching)流式场景下边生成边输出。扩缩容HPA/KEDA 按 QPS、队列、延迟扩缩;预热冷却 避免抖动。可观测延迟(P50/P99)、QPS、错误率 监控与告警;trace 做请求级排查。

三、存储、缓存与成本

模型:从 模型仓库 拉取或 挂载;大模型可 多副本加载按需加载缓存结果缓存(相同 prompt 直接返回)、KV cache 复用(vLLM 等);降低重复计算与延迟。成本:10 万 QPS 需 数十到数百 GPU 实例;Spot、混部、批处理缓存 控成本;多 region 做就近与容灾。

面试要点


记忆要点

  1. 高 QPS = 多实例 + LB + 批处理 + 扩缩容。
  2. 动态/连续 batching;HPA/KEDA;可观测。
  3. 缓存、限流、成本控制。
返回模块 返回总览