第 159 题:多目标的在线融合,A/B测试驱动的权重调整?
题目
多目标的在线融合,A/B测试驱动的权重调整?
完整讲解
一、多目标的在线融合
多目标(点击、转化、时长、留存等)在线上需融合成单一排序分或决策。在线融合即 serving 时对各目标分数做加权或组合,公式如
\(\text{score} = \sum_k w_k \cdot f_k(x),\quad \text{或} \quad \text{score} = \prod_k f_k(x)^{w_k},\)
其中 $f_k$ 为各目标模型输出,$w_k$ 为融合权重。权重若固定则可能不是当前业务最优;A/B 测试驱动的权重调整即在线上用实验找更好的 $w$。
二、A/B 测试驱动的权重调整
- 做法:将融合权重 $w$ 作为实验变量,设多个实验组(如组 A:$w_{\text{click}}=1, w_{\text{cvr}}=0.5$;组 B:$w_{\text{click}}=0.8, w_{\text{cvr}}=0.8$),在流量上分桶 A/B 测试,按业务主指标(GMV、ROI、留存等)比较,选最优组对应的 $w$。
- 迭代:先粗调(如 0.5/1/1.5 三档),再在最优附近细调;或做多臂 bandit(如 Thompson Sampling)在线探索 $w$,逐步收敛到高指标区域。
- 注意:主指标需与业务一致;实验周期要够、样本量要足;可分层(新老用户、场景)看 $w$ 是否需分群。
三、与离线权重的关系
- 离线:训练时多任务损失权重 $\lambda_k$ 影响各目标塔的梯度;离线调 $\lambda$ 可得到不同帕累托点。
- 在线:融合权重 $w$ 作用在推理分数上,与离线 $\lambda$ 可不同。通常先离线定各目标模型(或固定 $\lambda$),再在线调 $w$ 做融合,因在线调 $w$ 成本低、可快速 A/B;若需大范围调目标相对重要性,可同时调离线 $\lambda$ 与在线 $w$。
- 一致性:离线优化目标与线上主指标应对齐;若线上主指标为 GMV,融合权重 $w$ 应朝「GMV 最优」调,而非单纯点击或转化。
四、工程要点
- 融合公式与 $w$ 配置化,便于实验与回滚;可支持分场景/分人群的 $w$(如新用户偏点击、老用户偏转化)。
- 监控各目标分与融合分的分布,避免某路模型退化导致融合失真。
面试要点
- 能说明多目标在线融合的形式(加权和或加权积)及融合权重 $w$ 的作用。
- 能说清 A/B 驱动调权:多组 $w$ 分桶实验、按业务主指标选优、可迭代或 bandit 细调。
- 能区分离线损失权重 $\lambda$ 与在线融合权重 $w$;能提及分群 $w$ 与主指标对齐。
记忆要点
- 在线融合:$\text{score} = \sum w_k f_k$ 或 $\prod f_k^{w_k}$;A/B 测试不同 $w$、按主指标选优。
- 离线 $\lambda$ 训模型、在线 $w$ 融合;可先定模型再在线调 $w$,或 bandit 细调。
- $w$ 配置化、可分群;主指标与业务对齐。