ai-infra-interview-305

第 113 题:推理服务的auto-scaling策略?基于GPU利用率还是请求队列?

题目

推理服务的auto-scaling策略?基于GPU利用率还是请求队列?


完整讲解

一、基于 GPU 利用率的扩缩容

思路:监控实例的 GPU 利用率(如 nvidia-smi、DCGM);当 均值或 P95 高于阈值(如 80%)时 扩容,低于某阈值(如 30%)时 缩容优点:直接反映「算力是否吃满」。缺点:利用率高可能来自 少量大请求,此时扩容未必改善延迟;利用率低可能是 请求少batch 未填满,缩容可能增加排队。适用:吞吐优先、负载较平稳时;需设上下界与冷却时间,避免抖动。

二、基于请求队列的扩缩容

思路:监控 排队长度等待时间;队列超过某长度或等待时间超过 SLA 时 扩容,队列空且持续一段时间后 缩容优点:与 延迟/SLA 直接相关,更贴近「用户等多久」。缺点:需暴露队列指标、与负载均衡配合;短时尖峰可能触发过度扩容。适用:延迟敏感、有明确 SLA 时;常与 最大排队长度、超时 配合。

三、策略组合与建议


面试要点


记忆要点

  1. 利用率 = 算力维度;队列/延迟 = 用户体验维度。
  2. 延迟敏感以队列为主;吞吐/成本以利用率为参考。
  3. 扩缩容需 warmup 与 cooldown,避免抖动。
返回模块 返回总览