utilization监控?Prometheus + Grafana?集群的utilization监控?Prometheus + Grafana?
集群利用率:GPU/CPU 的使用率(如 nvidia-smi 的 GPU-Util、或基于 DCGM 的 SM 利用率)、显存占用、节点/卡在线与空闲比例等。高利用率表示资源被有效使用;长期低利用率说明空闲多、可做弹性或混部。需区分「分配率」(已分配/总资源)与「使用率」(实际算力/显存占用)。
Prometheus:拉取并存储时序指标;通过 exporter(如 DCGM Exporter 暴露 GPU 指标、node_exporter 暴露节点 CPU/内存/磁盘)采集各节点与 GPU 的 utilization、memory、temperature 等。Grafana:连接 Prometheus 做看板:曲线图、单值、表格,按节点/作业/队列聚合,设告警阈值。典型面板:集群总 GPU 利用率、每节点利用率、每作业占用、排队时长、失败率等。
| 返回模块 | 返回总览 |