ai-infra-interview-305

第 61 题:Tensor Parallelism(TP)的fused attention实现细节?

题目

Tensor Parallelism(TP)的fused attention实现细节?


完整讲解

一、TP 与 Attention 的切分关系

Tensor Parallelism 在 attention 层按 head 或 hidden 维度切分到多卡。Fused attention 把 Q/K/V 投影、softmax、output 投影合并成少量 kernel,减少显存读写与 launch 开销,在 TP 下每卡只算本分片的 Q、K、V,再做 all-gather/reduce-scatter 拼回或归约。

二、Fused attention 在 TP 下的实现要点

三、与 Megatron 的对应

Megatron-LM 的 fused QKV 与 column/row parallel 即上述模式:column 切 QKV 输出、row 切 O 输入,中间 attention 用 ring 或 all-gather 拼 full K/V 再算。实现时 fused kernel 的输入输出 shape 需与 TP 分片一致,通信插入在「需要完整 tensor」的边界。


面试要点


记忆要点

  1. TP fused attention = column 切 QKV + 中间通信拼 K/V + row 切 O。
  2. Fused 减少 launch 与显存带宽;通信与 Megatron column/row 策略一致。
  3. 实现时注意 fused kernel 的输入输出 shape 与分片一致。
返回模块 返回总览