observability?日志、指标、链路追踪?训练平台的observability?日志、指标、链路追踪?
可观测性(Observability):通过 日志、指标、链路追踪 理解系统行为、排查故障、优化性能。日志:结构化日志(JSON)含 job_id、rank、时间、级别、消息;集中收集(如 Loki、ELK)便于检索与告警。指标:时序指标(Prometheus)— GPU 利用率、吞吐、排队长度、失败率等;看板(Grafana)与 告警。链路追踪(Tracing):请求/job 级 从提交到各阶段(排队、调度、运行、写 checkpoint)的 span,便于看延迟分布与瓶颈。
作业级:排队时长、运行时长、吞吐、loss、通信占比、显存峰值。集群级:GPU 利用率、队列深度、成功率、成本与利用率趋势。节点级:DCGM、node_exporter、磁盘与网络。与业务:模型版本、数据集版本、实验 ID 等 label 便于按实验/用户/队列下钻。
| 返回模块 | 返回总览 |