ai-infra-interview-305

第 238 题:多模型multi-tenancy的GPU共享?MPS vs MIG

题目

多模型multi-tenancy的GPU共享?MPS vs MIG


完整讲解

一、多模型多租户 GPU 共享

多模型/多租户 共享同一 GPU:提高利用率、降成本;需 隔离(显存、算力、延迟)避免互相干扰。手段MPS(多进程共享一卡)、MIG(多实例 GPU,硬件分区)、多进程/多容器 各占部分显存与时间片。

二、MPS vs MIG

MPS(Multi-Process Service):多进程共享同一 GPU context,由 驱动做时间片调度显存 各进程分配但共享设备,算力 共享。优点:实现简单、无需硬件分区;缺点:无硬隔离,某进程大 kernel 会阻塞其他、公平性与长尾 难保证。MIG(Multi-Instance GPU):A100 等 可将单卡 硬件划分 为多份 MIG 实例,每实例有 独立显存与算力强隔离优点:隔离好、可预测;缺点:仅部分型号支持、分区粒度固定、总利用率可能略降。

三、选型与使用

小模型、多路推理、对隔离要求不高:可用 MPS,配合 限流或优先级 减轻互相影响。多租户、需 SLA 与隔离:优先 MIG单卡单模型(不共享)。K8s:MIG 可通过 device plugin 暴露为多「小 GPU」资源;MPS 下多 Pod 共享同卡,需 显存 limit并发控制

面试要点


记忆要点

  1. MPS = 多进程共享、时间片;MIG = 硬件分区、强隔离。
  2. MPS 简单无硬隔离;MIG 隔离好、部分卡支持。
  3. 按需求选;K8s 配合 device plugin 与 limit。
返回模块 返回总览