CPU、GPU、TPU统一调度?如何支持异构计算?CPU、GPU、TPU统一调度?
CPU、GPU、TPU 等 算力类型不同;任务可能指定「仅 GPU」「仅 TPU」或「CPU 兜底」。统一调度:资源池中 同时存在 多种设备类型;调度器按 job 的 request(如 nvidia.com/gpu、tpu.googleapis.com/v3)做 匹配与放置,并保证 同一 job 内 设备类型一致(或显式支持混合时再细说)。
资源抽象:每种设备通过 device plugin 或 自定义 resource 暴露(如 gpu、tpu、npux);request/limit 统一为「某 resource 的数量」。调度:scheduler 在 Filter 阶段排除不满足 resource 与 node label(如 accelerator=tpu-v3)的节点;Score 时可按类型、拓扑、利用率打分。运行时:训练代码 需 按设备类型 选后端(CUDA、XLA/TPU、CPU);平台通过 环境变量或注入 告知当前分配类型,或 同一镜像 内多后端并存、按 env 选择。
| 返回模块 | 返回总览 |