ai-infra-interview-305

第 73 题:Expert Parallelism在MoE模型中的all-to-all通信优化?

题目

Expert Parallelism在MoE模型中的all-to-all通信优化?


完整讲解

一、MoE 与 Expert Parallelism

MoE(Mixture of Experts)中,不同 token 被路由到不同 expert(子网络)。Expert Parallelism(EP):把不同 expert 放到不同 GPU,每卡负责若干 expert;前向时 token 按路由结果发送到对应卡,算完再按需汇总,涉及 all-to-all 或类似通信(token 按 expert 重排)。

二、All-to-All 的语义与成本

All-to-all:每卡有 (P) 个分片(如按 expert 或 token 分),通信后每卡得到来自所有卡的对应分片。数据量:(P) 卡、每卡原持 (n) 元素,总 (nP),all-to-all 后每卡仍约 (n) 量级但内容重排。通信量约 (n(P-1)/P) 每卡发送、类似接收,与 token 路由分布 相关;若路由不均,某卡可能收多发少或反之,需负载均衡。

三、优化方向


面试要点


记忆要点

  1. Expert parallel = expert 分卡,token 按路由 all-to-all 重排。
  2. 通信量级 = token 重排量;fused + overlap 降延迟。
  3. 路由与 capacity 影响负载均衡,需与 TP/PP 协调。
返回模块 返回总览