quota、limit、request?多租户场景下的资源配额管理?quota、limit、request?
Request:Pod/容器向 K8s 声明的「期望资源」,用于调度器决策(能否找到满足 request 的节点);Limit:该 Pod 最多可用资源上限,超限可能被 throttled 或 OOM kill。Quota:多租户场景下,对某 namespace 或某租户的总资源上限(如总 GPU 数、总 CPU),防止单租户占满集群。
(1)Namespace 级:每租户一个 namespace,设 ResourceQuota(总 CPU/内存/GPU)与 LimitRange(单 Pod 默认 limit)。(2)Request = Limit:对 GPU 推理常设 request 等于 limit,保证独占、避免超卖导致性能抖动。(3)Quota 与优先级:高优租户可配更大 quota 或单独资源池;结合优先级调度保证高优租户的 request 优先满足。(4)监控与告警:按租户统计实际使用与 quota 使用率,超配额则拒绝新调度或告警。
Quota 要略大于各租户 request 之和以允许碎片;GPU 可细到「每租户最大 GPU 数」;配合 RBAC 与计费做租户隔离与审计。
| 返回模块 | 返回总览 |