ai-infra-interview-305

14-集群调度(第 171–180 题)

题号 主题 文章
171 Slurm的sbatch脚本编写?gres资源申请? 171-Slurm的sbatch脚本编写.md
172 Kubernetes的volcano调度器在AI场景的应用? 172-Kubernetes的volcano调度器在AI场景的应用.md
173 训练任务的gang schedulingPyTorchJob的… 173-训练任务的gang-scheduling.md
174 多租户集群的resource quota和`priority cla… 174-多租户集群的resource-quota和priority-class.md
175 GPU集群的topology awareness调度?`NVLink… 175-GPU集群的topology-awareness调度.md
176 训练任务的preemption和`checkpoint & resu… 176-训练任务的preemption和checkpoint-&-resume.md
177 集群的utilization监控?Prometheus + `G… 177-集群的utilization监控.md
178 多集群的federated learning基础设施? 178-多集群的federated-learning基础设施.md
179 训练任务的cost accounting?按GPU小时计费? 179-训练任务的cost-accounting.md
180 集群的heterogeneous GPU管理?A100、`H10… 180-集群的heterogeneous-GPU管理.md

返回总览