ai-infra-interview-305

第 114 题:多模型混部的资源隔离?MPS(Multi-Process Service)?

题目

多模型混部的资源隔离?MPS(Multi-Process Service)?


完整讲解

一、多模型混部的挑战

多模型混部:同一 GPU(或同一节点)上同时跑 多个模型/多路推理,共享硬件。挑战:资源争抢(显存、算力、带宽)、互相干扰(某一路卡顿拖慢其他)、隔离与公平性(保证各模型有可预测的延迟与吞吐)。

二、资源隔离手段

三、MPS 的 role

MPS:NVIDIA 的 Multi-Process Service,让 多进程 共享同一 GPU context,减少每个进程单独占用的显存与启动开销;算力由驱动在进程间调度。适合 多小模型/多路推理 混部;需注意 公平性与长尾(某进程大 kernel 会阻塞其他),可配合 流优先级限流 使用。


面试要点


记忆要点

  1. 混部要隔离显存与算力;MPS 共享 context、算力由驱动调度。
  2. 每模型独立队列与并发上限,防单模型打满。
  3. MIG 可做更细 GPU 分片;MPS 适合多进程共享一卡。
返回模块 返回总览