ai-infra-interview-305

第 104 题:TensorRT-LLM的in-flight batching原理?

题目

TensorRT-LLM的in-flight batching原理?


完整讲解

一、In-Flight Batching 的含义

In-flight batching:与 continuous batching 同义——当前在执行的请求 组成一个「在飞」的 batch,每轮 decode 只对这些请求做一次前向;某请求生成完就离开 batch,新请求可加入。Batch 成员随时间变化,不等到「整批完成」再换批,从而提高 GPU 利用率、降低尾延迟。

二、TensorRT-LLM 的实现要点

三、与 Static 的对比

Static:batch 固定到整批完成;in-flight/continuous:batch 每轮更新,完成即出、可进新请求。TensorRT-LLM 的 in-flight batching 是其在 LLM 服务上对标 vLLM 的核心能力之一。


面试要点


记忆要点

  1. In-flight = continuous batching,batch 成员动态变化。
  2. 调度器每轮选 in-flight 请求;结束即释放、新请求即加入。
  3. 与 KV/block 管理结合,提高利用率与延迟。
返回模块 返回总览