第 68 题:STAR的星型拓扑,场景共享与场景特定参数的分离策略?
题目
STAR的星型拓扑,场景共享与场景特定参数的分离策略?
完整讲解
一、STAR 的星型拓扑
STAR(Single Task Adaptive Region)采用星型拓扑:中心为共享参数 $\Theta_{shared}$,每个场景/任务有场景特定参数 $\Theta_s$;同一层在推理时使用「共享 + 该场景特定」的组合,例如
\(\Theta_s^{eff} = \Theta_{shared} + \Theta_s,\quad \text{或}\quad \Theta_s^{eff} = \Theta_{shared} \odot (1 + \alpha_s) + \beta_s.\)
所有场景共享中心参数,各自仅增加少量场景参数,形成以共享为核心的星型结构。
二、场景共享与场景特定参数的分离策略
- 共享参数:从所有场景数据中学习通用表示与通用能力,参数量大、泛化好;负责「共性」。
- 场景特定参数:每个场景单独一份小参数(如 delta、缩放/偏置),只在该场景数据上更新或与共享联合更新,负责「个性」与分布偏移。
- 分离策略:底层可共享为主、场景参数做微调;高层可加大场景参数比例以适配不同目标或排序偏好。训练时可用多任务损失(各场景一个头)或按场景采样交替更新;正则可约束 $|\Theta_s|$ 避免场景参数过大、破坏共享。
三、与 PEPNet、MMOE 的对比
- STAR:显式「共享 + 每场景 delta」的星型结构,参数分离清晰。
- PEPNet:通过门控/调制网络生成个性化嵌入与参数,不直接存每场景完整 delta。
- MMOE:专家+门控,无显式「共享+场景参数」分解;STAR 更偏多场景/多域适配。
面试要点
- 能画出/描述星型拓扑:中心共享 $\Theta_{shared}$,每场景 $\Theta_s$,有效参数 $\Theta_{shared}+\Theta_s$(或门控形式)。
- 能说明分离策略:共享学共性、场景参数学个性;底层多共享、高层可多场景;训练多任务或按场景采样,正则约束场景参数。
- 能简要对比 STAR / PEPNet / MMOE 的适用点。
记忆要点
- STAR:星型拓扑,$\Theta_{eff}=\Theta_{shared}+\Theta_s$,共享中心 + 场景分支。
- 共享学共性、场景特定学个性;底层多共享、高层可多场景参数。
- 与 PEPNet:STAR 显式 delta;与 MMOE:STAR 为多场景参数分离。