ai-infra-interview-305

第 235 题:训练平台的observability?日志、指标、链路追踪?

题目

训练平台的observability?日志、指标、链路追踪?


完整讲解

一、Observability 的三大支柱

可观测性(Observability):通过 日志、指标、链路追踪 理解系统行为、排查故障、优化性能。日志结构化日志(JSON)含 job_id、rank、时间、级别、消息;集中收集(如 Loki、ELK)便于检索与告警。指标时序指标(Prometheus)— GPU 利用率、吞吐、排队长度、失败率等;看板(Grafana)与 告警链路追踪(Tracing):请求/job 级 从提交到各阶段(排队、调度、运行、写 checkpoint)的 span,便于看延迟分布与瓶颈。

二、训练平台具体指标

作业级:排队时长、运行时长、吞吐、loss、通信占比、显存峰值。集群级:GPU 利用率、队列深度、成功率、成本与利用率趋势。节点级:DCGM、node_exporter、磁盘与网络。与业务:模型版本、数据集版本、实验 ID 等 label 便于按实验/用户/队列下钻。

三、工程实践

统一采集:日志与 trace 带 trace_id/job_id,便于关联。采样:高 QPS 时 trace 可采样、日志可按级别过滤。保留与成本:指标可长期聚合;日志与 trace 按策略保留或归档。SLO:基于指标定义 SLA/SLO(如 P99 完成时间)、告警与 on-call。

面试要点


记忆要点

  1. 三支柱:日志、指标、trace。
  2. 作业/集群/节点指标;日志集中、trace 链路。
  3. 关联 ID、采样、保留、SLO。
返回模块 返回总览