ai-infra-interview-305

第 143 题:多租户场景下的资源配额管理?quotalimitrequest

题目

多租户场景下的资源配额管理?quotalimitrequest


完整讲解

一、Quota、Limit、Request 含义

Request:Pod/容器向 K8s 声明的「期望资源」,用于调度器决策(能否找到满足 request 的节点);Limit:该 Pod 最多可用资源上限,超限可能被 throttled 或 OOM kill。Quota:多租户场景下,对某 namespace 或某租户的总资源上限(如总 GPU 数、总 CPU),防止单租户占满集群。

二、多租户资源配额管理

(1)Namespace 级:每租户一个 namespace,设 ResourceQuota(总 CPU/内存/GPU)与 LimitRange(单 Pod 默认 limit)。(2)Request = Limit:对 GPU 推理常设 request 等于 limit,保证独占、避免超卖导致性能抖动。(3)Quota 与优先级:高优租户可配更大 quota 或单独资源池;结合优先级调度保证高优租户的 request 优先满足。(4)监控与告警:按租户统计实际使用与 quota 使用率,超配额则拒绝新调度或告警。

三、工程要点

Quota 要略大于各租户 request 之和以允许碎片;GPU 可细到「每租户最大 GPU 数」;配合 RBAC 与计费做租户隔离与审计。


面试要点


记忆要点

  1. Request/Limit = 单 Pod;Quota = 租户/namespace 总上限。
  2. 多租户 = namespace + Quota + LimitRange;GPU 常 request=limit。
  3. 监控、优先级、超配额处理必备。
返回模块 返回总览