ai-infra-interview-305

第 77 题:DeepSpeed-Infinity如何利用NVMe扩展显存?

题目

DeepSpeed-Infinity如何利用NVMe扩展显存?


完整讲解

一、DeepSpeed-Infinity 的思路

DeepSpeed-InfinityNVMe SSD 作为「第三级存储」:显存不够时把 optimizer state、梯度、甚至参数 offload 到 NVMe,需要时再按块读回。NVMe 容量大(TB 级)、带宽高于传统 SATA,比纯 CPU offload 的「CPU 内存」更可扩展,适合超大模型或长序列。

二、如何利用 NVMe 扩展显存

三、带宽与适用场景

NVMe 顺序读约数百 MB/s~数 GB/s,仍低于 PCIe GPU 带宽;因此 Infinity 适合「显存与 CPU 内存都不够、但可接受一定 IO 延迟」的超大模型训练。通过 overlap、预取、分层,把 IO 藏在计算后面,减轻对吞吐的影响。


面试要点


记忆要点

  1. NVMe = 第三级存储,容量大、带宽低于 GPU/PCIe。
  2. 分层 + prefetch + overlap 是关键;按块读写、可选压缩。
  3. 适用:超大模型、显存与 CPU 都不够。
返回模块 返回总览