ai-infra-interview-305

第 135 题:GPU虚拟化方案?MIG(Multi-Instance GPU)的配置?

题目

GPU虚拟化方案?MIG(Multi-Instance GPU)的配置?


完整讲解

一、GPU 虚拟化方案概览

物理独占:一卡一任务,无虚拟化。时间片/分时:多任务共享一卡,由调度器切换,上下文切换有开销。MIG(Multi-Instance GPU):A100 及以后部分卡支持将一块 GPU 切成多个小实例,每个实例有独立显存与算力,隔离性好,适合小模型多实例部署。vGPU(如 vGPU 软件方案):将单卡虚拟成多块「小卡」,多用于云与多租户。容器 + 设备分配:K8s 下用 limits 分配整卡或 MIG 实例给不同 Pod,逻辑隔离。

二、MIG 配置

MIG 将 GPU 按「slice」划分,如 A100 可配成 7×1g.5gb(7 个 1/7 算力+显存实例)或 3×2g.10gb 等。配置步骤:在节点上启用 MIG mode(需支持 MIG 的卡与驱动),用 nvidia-smi mig 创建实例规格,再通过 device plugin 或 K8s 资源(如 nvidia.com/mig-1g.5gb)把实例暴露给 Pod。每个 MIG 实例有独立 UUID,调度时按资源名申请即可。注意:启用 MIG 后整卡不再作为单设备使用,需规划好切分与实例数。

三、选型

小模型、多实例、强隔离用 MIG;大模型单卡或多卡用物理卡;云上多租户常结合 vGPU 或 MIG + 配额。


面试要点


记忆要点

  1. MIG = 一块 GPU 切成多实例,独立显存与算力,A100+ 支持。
  2. 配置 = MIG mode + mig 实例规格 + device plugin 暴露资源名。
  3. 小模型多实例、隔离选 MIG;大模型用整卡。
返回模块 返回总览