| 题号 | 主题 | 文章 |
|——|——|——|
| 131 | Triton Inference Server的model ensem… | [131-Triton-Inference-Server的model-ensemble.md](/ai-infra-interview-305/11-%E6%9C%8D%E5%8A%A1%E5%8C%96%E4%B8%8E%E8%B0%83%E5%BA%A6/131-Triton-Inference-Server%E7%9A%84model-ensemble.html) |
| 132 | Triton的dynamic batching和preferred… | 132-Triton的dynamic-batching和preferred-batc.md |
| 133 | 推理服务的A/B testing如何实现?模型版本管理? | 133-推理服务的A-B-testing如何实现.md |
| 134 | Kubernetes + NVIDIA GPU Operator… | 134-Kubernetes-+-NVIDIA-GPU-Operator的部署经验.md |
| 135 | GPU虚拟化方案?MIG(Multi-Instance GPU)的配… | 135-GPU虚拟化方案.md |
| 136 | 推理请求的priority scheduling实现?weight… | [136-推理请求的priority-scheduling实现.md](/ai-infra-interview-305/11-%E6%9C%8D%E5%8A%A1%E5%8C%96%E4%B8%8E%E8%B0%83%E5%BA%A6/136-%E6%8E%A8%E7%90%86%E8%AF%B7%E6%B1%82%E7%9A%84priority-scheduling%E5%AE%9E%E7%8E%B0.html) |
| 137 | 长文本请求的preemption策略?KV cache的swap o… | [137-长文本请求的preemption策略.md](/ai-infra-interview-305/11-%E6%9C%8D%E5%8A%A1%E5%8C%96%E4%B8%8E%E8%B0%83%E5%BA%A6/137-%E9%95%BF%E6%96%87%E6%9C%AC%E8%AF%B7%E6%B1%82%E7%9A%84preemption%E7%AD%96%E7%95%A5.html) |
| 138 | 推理服务的health check和graceful degrad… | 138-推理服务的health-check和graceful-degradation.md |
| 139 | 如何监控推理服务的GPU memory泄漏? | 139-如何监控推理服务的GPU-memory泄漏.md |
| 140 | 推理模型的hot reload如何实现?零停机更新? | 140-推理模型的hot-reload如何实现.md |
| 141 | gRPC vs REST for inference?性能差异和… | 141-gRPC-vs-REST-for-inference.md |
| 142 | 推理批处理的timeout处理?部分结果返回? | 142-推理批处理的timeout处理.md |
| 143 | 多租户场景下的资源配额管理?quota、limit、reque… | [143-多租户场景下的资源配额管理.md](/ai-infra-interview-305/11-%E6%9C%8D%E5%8A%A1%E5%8C%96%E4%B8%8E%E8%B0%83%E5%BA%A6/143-%E5%A4%9A%E7%A7%9F%E6%88%B7%E5%9C%BA%E6%99%AF%E4%B8%8B%E7%9A%84%E8%B5%84%E6%BA%90%E9%85%8D%E9%A2%9D%E7%AE%A1%E7%90%86.html) |
| 144 | 推理服务的cost optimization`策略?Spot inst… | 144-推理服务的cost-optimization策略.md |
| 145 | Edge deployment的挑战?模型加密、设备兼容性? | 145-Edge-deployment的挑战.md |