heterogeneous GPU管理?A100、H100、4090混部?集群的heterogeneous GPU管理?A100、H100、4090混部?
异构:集群中同时存在 A100、H100、4090 等不同型号,算力、显存、NVLink 与驱动/库支持不同。调度:需识别每块卡的类型与能力,按任务需求(如「必须 A100 80G」「可接受 4090」)做匹配与放置;避免大模型任务被分到显存不足的卡、或混部导致驱动/CUDA 版本冲突。
设备插件:NVIDIA K8s Device Plugin 等可暴露 nvidia.com/gpu 及扩展标签(如 gpu-type=a100、memory=80Gi)。Slurm 的 gres 可配置多种类型(如 gpu:a100:2,gpu:h100:1)。调度器按 node label / resource request 做筛选:例如 Pod 请求 nvidia.com/gpu: 1 且 nodeSelector gpu-type=a100,则只调度到 A100 节点。
| 返回模块 | 返回总览 |