ai-infra-interview-305

第 105 题:FasterTransformer的decoder优化技术?memory layout优化?

题目

FasterTransformer的decoder优化技术?memory layout优化?


完整讲解

一、FasterTransformer Decoder 的优化方向

FasterTransformer(NVIDIA)对 Transformer decoder(如 GPT、T5 decoder)做 kernel 融合、内存布局、批处理 等优化,目标低延迟与高吞吐。Decoder 特点:自回归、每步只生成 1 token、强依赖 KV cache 与 attention。

二、Decoder 优化技术

三、Memory Layout

Memory layout 优化:使 连续访问计算顺序 一致(如 batch 维连续、或 KV 按 step 连续写),减少 bank conflict 与 cache miss;或把 KV 与权重按「分块」排布,配合 tiled attention。文档与源码中的「memory layout」多指 KV cache 与中间 buffer 的排布选择,以适配其 fused kernel。


面试要点


记忆要点

  1. 融合 kernel + KV layout + 批处理/变长 + 低精度。
  2. Layout 优化 = 访存顺序与计算一致、减少冲突与 miss。
  3. 针对 decoder 自回归、KV cache 密集的特点优化。
返回模块 返回总览