latency SLO保证?p99 < 100ms如何实现?推理服务的latency SLO保证?p99 < 100ms如何实现?
SLO:服务等级目标,如「P99 延迟 < 100ms」。保证:通过 容量、限流、排队与调度 使 绝大多数请求 满足该目标;超 SLO 则告警、扩容或降载。
容量:压测与建模 得到「单实例在目标负载下的 P99」;实例数 与 负载 满足「总 P99 低于 100ms」(考虑排队与长尾)。排队:请求队列 不宜过长;动态 batching 的 最大等待时间 需小于 SLO 的一部分;或 限流 使排队可控。长尾:P99 受 冷启动、编译、GC、noisy neighbor 影响;预热、预编译、显存预留、隔离(单实例单模型或 MIG)减长尾。监控:实时 P99 与 SLO 燃烧率;超阈值则 扩容或告警;trace 定位 P99 请求特征(大 batch、长 seq 等)。
| 返回模块 | 返回总览 |