ai-infra-interview-305

第 190 题:如何构建端到端的性能监控dashboard?

题目

如何构建端到端的性能监控dashboard?


完整讲解

一、端到端监控的目标

端到端:从作业提交/请求进入训练 step 或推理完成的全链路,包含调度等待、数据加载、计算、通信、存储等。监控目标:吞吐、延迟、利用率、排队、失败率 等可观测指标,用于容量规划、SLA 与故障定位。

二、数据来源与指标

指标来源:调度器(排队时长、分配资源、开始/结束时间);训练/推理进程(通过 Prometheus exporter、日志解析、或框架 callback 上报 step 耗时、loss、GPU 利用率、通信时间);节点与 GPU(DCGM、node_exporter);存储与网络(可选)。关键指标:job 级(排队时间、运行时长、吞吐 samples/s、通信占比);集群级(GPU 利用率、队列深度、失败率);推理级(QPS、P99 延迟、错误率)。

三、Dashboard 设计

Grafana 等连接 Prometheus(或其它时序库),按层级组织:总览(集群利用率、队列、今日完成 job 数);单 job/单服务(该 job 的 step 时间、通信、loss 曲线);单节点/单卡(GPU 利用率、显存、温度)。告警:利用率异常、排队超时、失败率突增、P99 超 SLA 等。链路:若需 request 级追踪,可集成 trace(如 OpenTelemetry)做从请求到各阶段的 span。

面试要点


记忆要点

  1. 端到端 = 全链路;调度、计算、通信、存储都要可观测。
  2. 指标:job 级 + 集群级 + 推理级;Prometheus + exporter/callback。
  3. Grafana 分层看板 + 告警;可选 trace。
返回模块 返回总览