ai-infra-interview-305

第 48 题:FSDP的sharding strategy有哪些?FULL_SHARD vs SHARD_GRAD_OP

题目

FSDP的sharding strategy有哪些?FULL_SHARD vs SHARD_GRAD_OP


完整讲解

一、FSDP 的 sharding 在 shard 什么?

FSDP 对参数(以及可选地梯度、优化器状态)做分片:每张卡只存 1/N,forward/backward 时按需 all-gather。Sharding strategy 决定「在哪个阶段对哪些东西做分片」。


二、常见策略(PyTorch FSDP 命名)


三、FULL_SHARD vs SHARD_GRAD_OP

选型:单卡放不下整模型 → FULL_SHARD;能放下参数、只想省梯度和优化器 → SHARD_GRAD_OP 或 ZeRO-2 风格。


面试要点


记忆要点

  1. FULL_SHARD:全分片,显存最小,通信最大;SHARD_GRAD_OP:梯度/优化器分片,参数可复制。
  2. NO_SHARD ≈ DDP;HYBRID 用于多机。
  3. 模型过大用 FULL_SHARD;能放参数用 SHARD_GRAD_OP 折中。
返回模块 返回总览