ai-infra-interview-305

第 247 题:推理服务的cost optimizationspot instancebatching

题目

推理服务的cost optimizationspot instancebatching


完整讲解

一、推理 cost 的构成

成本算力(GPU 实例)、存储(模型与缓存)、网络与带宽。优化目标:在 满足 SLA降低单位请求成本总成本

二、Spot instance

Spot(抢占式实例):价格低、可能被 随时回收推理无状态、可快速迁移;某实例被回收时 其他副本 接流量、新实例 再起。适用批处理、非实时、可容忍偶发中断 的推理;或 与 on-demand 混部,Spot 扛基线、on-demand 兜底尖峰。实现调度 支持 Spot 节点池;Pod 容忍 Spot 的 taint;优雅退出健康检查 配合,回收前尽量排空请求。

三、Batching

Batching多请求 合并为 一 batch 推理,提高 GPU 利用率、降低 单请求成本动态 batching:请求排队、凑满 batch 或超时后一起推理;连续 batching(流式)边生成边收新请求。权衡:batch 大则 吞吐高、成本低,但 排队与延迟 增;需按 SLA 调 batch 大小与超时。其它模型量化、小模型、缓存 也降单次推理成本;缩容与弹性 在低峰减实例。

面试要点


记忆要点

  1. Cost = 算力+存储+网络;Spot + batching + 量化+缓存。
  2. Spot 无状态可接、混部兜底;batching 提利用率。
  3. 与 SLA 权衡;弹性缩容。
返回模块 返回总览