fat-tree、dragonfly?多机训练的网络拓扑?fat-tree、dragonfly?
多机多卡训练时,通信拓扑决定 all-reduce 等集合通信的跳数、带宽、拥塞。理想情况:每对节点间带宽大、延迟低、无单点瓶颈。常见拓扑有 fat-tree、dragonfly、mesh 等。
Fat-tree(胖树):自上而下带宽递增(越靠近核心越宽),叶子为计算节点、上层为交换机。同 pod 内通信走下层、跨 pod 走上层;无 oversubscription( bisection 带宽充足)时通信性能好。常用于数据中心、HPC;成本与布线复杂度较高。
Dragonfly:分组(group)内全连或高连接,组间通过少量链路连接,形成「组内密、组间疏」的层次。全局负载均衡:通信尽量走组内或少跳,长距离流量分散到多条路径,减少热点。适合超大规模、对 bisection 与平均跳数有要求的场景。与 fat-tree 相比,在相同端口数下可 scale 更多节点,但路由与负载均衡更复杂。
| 返回模块 | 返回总览 |