sgr-interview-300

第 118 题:GPU上的批量检索,TensorRT-LLM的优化技巧?

题目

GPU上的批量检索,TensorRT-LLM的优化技巧?


完整讲解

一、GPU 上的批量检索

推荐与检索场景常需单请求多候选多请求并行。在 GPU 上做向量检索时,将多条 query 或同一 query 的多路候选组成 batch,利用 GPU 并行算距离(矩阵乘、L2/内积 kernel),可提高吞吐、摊薄显存与调度开销。批量检索的核心是:批量化距离计算 + 批量化 Top-K/堆,以及减少 CPU-GPU 传输与 kernel 启动次数。

二、TensorRT-LLM 的关联与可借鉴点

TensorRT-LLM 主要面向大语言模型推理,其优化思路可迁移到检索侧(尤其 RAG、向量检索与 LLM 同 pipeline 时):(1)算子融合:将多层/多步计算合并为少量 kernel,减少显存读写与 launch 开销;(2)连续内存与批处理:batch 内请求连续排布、统一 shape,便于矩阵运算与内存对齐;(3)动态 batch:请求队列积累到一定 batch 或超时后统一推理,提高 GPU 利用率;(4)KV cache / 状态复用:对检索而言可类比「向量/索引块常驻显存、只传 query batch」;(5)精度与量化:FP16/BF16 或 INT8 降低带宽与算量,检索同样可用半精度距离。

三、检索侧的批量优化技巧

四、注意点


面试要点


记忆要点

返回模块 返回总览