sgr-interview-300

第 214 题:GPU显存优化,模型并行与流水线并行?

题目

GPU显存优化,模型并行与流水线并行?


完整讲解

一、GPU 显存瓶颈

大模型(如 LLM、大视觉模型)的参数量与激活超出单卡显存,无法单卡加载或 batch 很小。优化思路:模型并行(把模型拆到多卡)、流水线并行(按层或 stage 分到多卡、流水执行)、数据并行(多卡同模型、分数据)可组合使用。

二、模型并行(Tensor Parallelism)

三、流水线并行(Pipeline Parallelism)


面试要点


记忆要点

返回模块 返回总览