实时推理和离线推理的统一架构?
实时:低延迟、请求-响应 同步或流式;QPS 与 SLA 要求高;动态 batching、连续 batching。离线:批处理、高吞吐、可 排队与调度;延迟 要求松(分钟级可接受);大 batch、多 job 跑在集群上。统一架构:同一套模型与运行时,通过 调度与资源配置 区分「实时服务」与「离线批处理」,减少 两套栈 的维护与不一致。
共享:模型仓库、同一推理引擎(如 vLLM、Triton)、同一镜像与版本;实时 与 离线 都从同一仓库拉模型、同一引擎执行。调度分层:实时 用 常驻服务 + HPA,请求经 LB 进实例;离线 用 Job 队列(如 K8s Job、Ray、队列消费),按需起任务、大 batch、跑完即释。资源:实时 占 预留或弹性 实例;离线 用 空闲或 Spot,可与实时 混部(离线填谷)、或 独立池。API:统一 推理 API(如 OpenAI 兼容);实时 同步/流式 调用;离线 异步(提交 job、轮询或回调取结果)。
| 返回模块 | 返回总览 |