第 247 题:推理服务的cost optimization?spot instance、batching?
题目
推理服务的cost optimization?spot instance、batching?
完整讲解
一、推理 cost 的构成
成本:算力(GPU 实例)、存储(模型与缓存)、网络与带宽。优化目标:在 满足 SLA 下 降低单位请求成本 或 总成本。
二、Spot instance
Spot(抢占式实例):价格低、可能被 随时回收。推理:无状态、可快速迁移;某实例被回收时 其他副本 接流量、新实例 再起。适用:批处理、非实时、可容忍偶发中断 的推理;或 与 on-demand 混部,Spot 扛基线、on-demand 兜底尖峰。实现:调度 支持 Spot 节点池;Pod 容忍 Spot 的 taint;优雅退出 与 健康检查 配合,回收前尽量排空请求。
三、Batching
Batching:多请求 合并为 一 batch 推理,提高 GPU 利用率、降低 单请求成本。动态 batching:请求排队、凑满 batch 或超时后一起推理;连续 batching(流式)边生成边收新请求。权衡:batch 大则 吞吐高、成本低,但 排队与延迟 增;需按 SLA 调 batch 大小与超时。其它:模型量化、小模型、缓存 也降单次推理成本;缩容与弹性 在低峰减实例。
面试要点
- 成本:算力、存储、网络;优化 = Spot、batching、量化、缓存、弹性。
- Spot:低价、可回收;无状态推理可接;与 on-demand 混部、优雅退出。
- Batching:提高利用率、降单请求成本;与延迟权衡;动态/连续 batching。
记忆要点
- Cost = 算力+存储+网络;Spot + batching + 量化+缓存。
- Spot 无状态可接、混部兜底;batching 提利用率。
- 与 SLA 权衡;弹性缩容。