第 84 题:多节点场景下的显存优化策略差异?
题目
多节点场景下的显存优化策略差异?
完整讲解
一、多节点带来的差异
多节点下 显存 仍是「每卡本地」的,但 通信 跨节点(机间带宽低、延迟高)。显存优化策略本身(checkpoint、offload、分片)不变,但 通信与显存的权衡 会变:例如梯度 all-reduce 跨机,通信更贵,可能倾向 增大 batch 或减少通信次数(如梯度累积、压缩);offload 到 CPU 时,若 CPU 内存也在本机,多节点与单机类似,若涉及跨机 CPU 则一般不这么做。
二、策略差异要点
- ZeRO/分片:多节点时 DP 的 all-reduce 跨机,梯度压缩(fp16/bf16、稀疏)收益更大;ZeRO-3 参数也跨机 gather,通信量更大,需权衡 stage 与 overlap。
- Checkpoint:与单机相同,多用 checkpoint 降显存可换更大 batch;多节点下 global batch 往往更大,单卡 batch 不变时 DP 度更高,all-reduce 成本上升,有时会适当减 DP 或做通信重叠。
- Offload:ZeRO-Offload 的 CPU 在本机,多节点时每机独立 offload;Infinity 的 NVMe 也可每机本地,避免跨机 IO。多节点一般不把显存 offload 到「其他节点的 CPU」,延迟与带宽都差。
三、小结
多节点下显存优化手段一致,但 通信成本 上升,需更注重:通信压缩、通信与计算重叠、以及 DP/TP/PP 的划分(TP 同机、DP 跨机时 all-reduce 量要控制)。Offload 仍以本机 CPU/NVMe 为主。
面试要点
- 多节点显存仍是每卡本地;差异在通信跨机、延迟与带宽更差。
- 策略:更重视梯度压缩、通信重叠;ZeRO/checkpoint 仍用,offload 限本机。
- TP 同机、DP 跨机时控制 all-reduce 量与 overlap。
记忆要点
- 多节点 = 通信贵;显存手段不变,更强调压缩与重叠。
- Offload 用本机 CPU/NVMe,不跨机 offload。
- 划分上 TP 同机、DP 跨机,控制通信量。