sgr-interview-300

第 212 题:Triton Inference Server的动态批处理,延迟与吞吐的权衡?

题目

Triton Inference Server的动态批处理,延迟与吞吐的权衡?


完整讲解

一、动态批处理的目的

批处理(Batching):将多个请求拼成一批再送 GPU 推理,提高吞吐(GPU 利用率);单条推理延迟高时批处理可摊薄。动态:请求到达时间不定,批大小不固定,需在等待更多请求(凑批、提高吞吐)与尽快返回(降低延迟)间权衡。

二、Triton 的动态批处理

三、延迟与吞吐的权衡


面试要点


记忆要点

返回模块 返回总览