topology awareness调度?NVLink拓扑?GPU集群的topology awareness调度?NVLink拓扑?
拓扑感知调度:在分配 GPU(或 NUMA、网卡)时,考虑硬件拓扑(如 NVLink 连接、PCIe 树、NUMA 节点),优先把同一作业的 GPU 安排在通信延迟低、带宽高的组内,从而提升 all-reduce 等通信效率、缩短训练时间。
NVLink:GPU 间高速直连;同一节点内多卡可能通过 NVLink 全连接(如 8×A100 全连)或部分连接。调度时若「尽量把同一 job 的 8 卡放在同一节点、且选 NVLink 拓扑最优的节点」,可最大化带宽。多节点:节点间通过 IB/RoCE;同一 job 的节点宜在相近拓扑(同 rack、同 leaf)以减少跨级跳数。
nvidia.com/nvlink);调度器在 Score 阶段对「请求多 GPU 的 Pod」优先选 NVLink 带宽高的节点。K8s:可扩展 scheduler plugin 或使用 Volcano 的 binpack / topology 策略;Slurm 的 cons_res 与 topology/tree 可做类似约束。CRI/容器:保证分配到的 GPU 与上报拓扑一致,避免跨 NUMA 或远距离 PCIe。| 返回模块 | 返回总览 |