ai-infra-interview-305

第 249 题:推理服务的latency SLO保证?p99 < 100ms如何实现?

题目

推理服务的latency SLO保证?p99 < 100ms如何实现?


完整讲解

一、Latency SLO 的含义

SLO服务等级目标,如「P99 延迟 < 100ms」。保证:通过 容量、限流、排队与调度 使 绝大多数请求 满足该目标;超 SLO 则告警、扩容或降载。

二、如何实现 P99 < 100ms

容量压测与建模 得到「单实例在目标负载下的 P99」;实例数负载 满足「总 P99 低于 100ms」(考虑排队与长尾)。排队请求队列 不宜过长;动态 batching最大等待时间 需小于 SLO 的一部分;或 限流 使排队可控。长尾P99冷启动、编译、GC、noisy neighbor 影响;预热预编译显存预留隔离(单实例单模型或 MIG)减长尾。监控实时 P99SLO 燃烧率;超阈值则 扩容或告警trace 定位 P99 请求特征(大 batch、长 seq 等)。

三、与容量与成本权衡

保证 P99 常需 过量供给保守 batching;与 成本 冲突。实践:按 SLA 分级(如核心接口 P99<100ms、其它 best-effort);弹性 在高峰扩容、低峰缩容;降级(如超载时返回缓存或简化模型)保核心。

面试要点


记忆要点

  1. SLO = P99 等目标;容量+排队+长尾控制。
  2. 预热、预编译、隔离;监控 P99、trace 定位。
  3. 分级、弹性、降级。
返回模块 返回总览