ai-infra-interview-305

第 253 题:实时推理和离线推理的统一架构?

题目

实时推理和离线推理的统一架构?


完整讲解

一、实时与离线推理的差异

实时低延迟请求-响应 同步或流式;QPS 与 SLA 要求高;动态 batching、连续 batching离线批处理高吞吐、可 排队与调度延迟 要求松(分钟级可接受);大 batch、多 job 跑在集群上。统一架构同一套模型与运行时,通过 调度与资源配置 区分「实时服务」与「离线批处理」,减少 两套栈 的维护与不一致。

二、统一架构思路

共享模型仓库同一推理引擎(如 vLLM、Triton)、同一镜像与版本实时离线 都从同一仓库拉模型、同一引擎执行。调度分层实时常驻服务 + HPA,请求经 LB 进实例;离线Job 队列(如 K8s Job、Ray、队列消费),按需起任务、大 batch、跑完即释。资源实时预留或弹性 实例;离线空闲或 Spot,可与实时 混部(离线填谷)、或 独立池API统一 推理 API(如 OpenAI 兼容);实时 同步/流式 调用;离线 异步(提交 job、轮询或回调取结果)。

三、与成本、优先级

优先级实时 高优、离线 低优;离线 可抢占backfill 实时空闲时段的资源。成本:离线多用 Spot、弹性;统一架构下 资源池 共享,利用率 更高。

面试要点


记忆要点

  1. 实时 vs 离线:延迟 vs 吞吐;统一 = 同模型同引擎。
  2. 调度:实时常驻、离线 Job;资源可混部。
  3. 优先级、Spot、backfill。
返回模块 返回总览