ai-infra-interview-305

第 112 题:如何评估推理引擎的延迟分布?P50、P90、P99的优化重点?

题目

如何评估推理引擎的延迟分布?P50、P90、P99的优化重点?


完整讲解

一、延迟分布与 P50/P90/P99

P50(中位数):一半请求低于该值;P90:90% 请求低于该值;P99:99% 低于该值。P99 反映 长尾延迟,常用于 SLA(如「P99 < 500ms」)。评估时需在稳定负载下采集足够样本(如数万次请求),按延迟排序取百分位;区分 首 token 延迟(TTFT)每 token 延迟(流式场景)。

二、优化重点

三、指标与 SLA


面试要点


记忆要点

  1. P50 典型、P99 长尾;SLA 常用 P99。
  2. P99 差:排队、冷启动、显存、GC、新 shape;先稳 P99 再压 P50。
  3. 打流 + 直方图 + trace 定位长尾请求特征。
返回模块 返回总览