| 171 |
Slurm的sbatch脚本编写?gres资源申请? |
171-Slurm的sbatch脚本编写.md |
| 172 |
Kubernetes的volcano调度器在AI场景的应用? |
172-Kubernetes的volcano调度器在AI场景的应用.md |
| 173 |
训练任务的gang scheduling?PyTorchJob的… |
173-训练任务的gang-scheduling.md |
| 174 |
多租户集群的resource quota和`priority cla… |
174-多租户集群的resource-quota和priority-class.md |
| 175 |
GPU集群的topology awareness调度?`NVLink… |
175-GPU集群的topology-awareness调度.md |
| 176 |
训练任务的preemption和`checkpoint & resu… |
176-训练任务的preemption和checkpoint-&-resume.md |
| 177 |
集群的utilization监控?Prometheus + `G… |
177-集群的utilization监控.md |
| 178 |
多集群的federated learning基础设施? |
178-多集群的federated-learning基础设施.md |
| 179 |
训练任务的cost accounting?按GPU小时计费? |
179-训练任务的cost-accounting.md |
| 180 |
集群的heterogeneous GPU管理?A100、`H10… |
180-集群的heterogeneous-GPU管理.md |