第 63 题:PLE的渐进式层分离,显式路径的梯度阻塞设计?
题目
PLE的渐进式层分离,显式路径的梯度阻塞设计?
完整讲解
一、PLE 的渐进式层分离
PLE(Progressive Layered Extraction)在 MMOE 基础上做层级化专家分离:底层有「任务共享专家」与「任务专属专家」,逐层往上,每层通过门控只融合当前层及下层的专家输出,高层任务不再直接依赖底层所有专家,从而显式减少负迁移、加强任务特定信息向上传递。
二、显式路径与梯度阻塞
- 显式路径:每个任务有清晰路径——先经过共享/自有专家混合,再经任务塔。门控决定每层各专家权重,形成「任务 → 专家子集 → 输出」的显式路由。
- 梯度阻塞:PLE 通过结构设计实现「梯度隔离」:某任务的梯度只回传到该任务所经过的专家与共享部分,其它任务的专属专家不会收到该任务梯度;同层内任务专属专家之间无直接参数共享,因此梯度不会在任务间乱窜,减轻梯度冲突与负迁移。可理解为在计算图上,非该任务路径上的连接在反向时等价于被阻塞或权重为 0。
三、与 MMOE 的对比
MMOE 所有任务共享同一组专家,仅门控不同;PLE 在专家层面就区分共享与任务特定,且多层递进,显式路径 + 梯度隔离,更适合任务冲突大、层级特征差异明显的场景。
面试要点
- 能说清 PLE 的「渐进式层分离」:层级化专家(共享 + 任务专属),逐层门控融合,高层不直接依赖底层全部专家,减少负迁移。
- 能解释显式路径:任务有明确「专家子集 → 塔」路径;梯度阻塞:某任务梯度只回传其路径上的参数,其它任务专属专家不收该梯度,实现梯度隔离。
- 能对比 MMOE:共享专家+门控;PLE:专家即分离 + 多层 + 梯度隔离,更适合冲突大的多任务。
记忆要点
- PLE:渐进式层分离,共享/任务专属专家分层、逐层门控;显式任务路径。
- 梯度阻塞:任务梯度只沿自身路径回传,不流入其它任务专属专家,减轻冲突。
- 与 MMOE:PLE 专家级分离 + 多层 + 梯度隔离,冲突大时更稳。