ai-infra-interview-305

第 294 题:多机训练的网络拓扑?fat-treedragonfly

题目

多机训练的网络拓扑?fat-treedragonfly


完整讲解

一、多机训练与拓扑

多机多卡训练时,通信拓扑决定 all-reduce 等集合通信的跳数、带宽、拥塞。理想情况:每对节点间带宽大、延迟低、无单点瓶颈。常见拓扑有 fat-treedragonflymesh 等。

二、Fat-tree

Fat-tree(胖树):自上而下带宽递增(越靠近核心越宽),叶子为计算节点、上层为交换机。同 pod 内通信走下层、跨 pod 走上层;无 oversubscription( bisection 带宽充足)时通信性能好。常用于数据中心、HPC;成本与布线复杂度较高。

三、Dragonfly

Dragonfly分组(group)内全连或高连接,组间通过少量链路连接,形成「组内密、组间疏」的层次。全局负载均衡:通信尽量走组内或少跳,长距离流量分散到多条路径,减少热点。适合超大规模、对 bisection 与平均跳数有要求的场景。与 fat-tree 相比,在相同端口数下可 scale 更多节点,但路由与负载均衡更复杂。


面试要点


记忆要点

  1. Fat-tree = 胖树、带宽递增、无 oversubscription 时通信好。
  2. Dragonfly = 组内全连/高连、组间稀疏;负载均衡、少跳。
  3. 拓扑决定 all-reduce 等通信的跳数与带宽。
返回模块 返回总览