ai-infra-interview-305

第 84 题:多节点场景下的显存优化策略差异?

题目

多节点场景下的显存优化策略差异?


完整讲解

一、多节点带来的差异

多节点下 显存 仍是「每卡本地」的,但 通信 跨节点(机间带宽低、延迟高)。显存优化策略本身(checkpoint、offload、分片)不变,但 通信与显存的权衡 会变:例如梯度 all-reduce 跨机,通信更贵,可能倾向 增大 batch 或减少通信次数(如梯度累积、压缩);offload 到 CPU 时,若 CPU 内存也在本机,多节点与单机类似,若涉及跨机 CPU 则一般不这么做。

二、策略差异要点

三、小结

多节点下显存优化手段一致,但 通信成本 上升,需更注重:通信压缩、通信与计算重叠、以及 DP/TP/PP 的划分(TP 同机、DP 跨机时 all-reduce 量要控制)。Offload 仍以本机 CPU/NVMe 为主。


面试要点


记忆要点

  1. 多节点 = 通信贵;显存手段不变,更强调压缩与重叠。
  2. Offload 用本机 CPU/NVMe,不跨机 offload。
  3. 划分上 TP 同机、DP 跨机,控制通信量。
返回模块 返回总览