第 18 题:模型集成(Bagging/Boosting)在推荐中的落地难点,如何降低 serving 成本?
题目
模型集成(Bagging/Boosting)在推荐中的落地难点,如何降低serving成本?
完整讲解
一、落地难点
- 延迟:推荐精排常在 10~50ms 内要返回,集成多模型(如 5~10 个)串行或并行推理,延迟成倍增加,难以满足线上 SLA。
- 资源:多份模型显存/内存、QPS 放大,机器与成本高。
- 更新:多模型要一起训练、一起发布,迭代与运维复杂;版本不一致易出问题。
- 收益递减:模型已经较大时,再集成多个大模型,边际收益有限而成本明显。
二、降低 serving 成本的做法
- 蒸馏:用集成模型(或单大模型)做教师,蒸馏成单模型,serving 只跑一个模型,延迟与资源与单模型一致,大部分效果可保留。
- 模型压缩:集成前先对子模型剪枝/量化,再集成,在「效果-成本」之间折中。
- 选择性集成:不是所有请求都走全量集成,例如粗排用单模型、精排对高分或高价值请求用 2~3 个模型投票,控制放大倍数。
- 共享底层:多模型共享 Embedding 与部分层,只顶层不同,推理时共享部分算一次,减少重复计算。
- 离线集成:离线用集成得到分数或排序,线上只做检索与简单打分(如单模型),适合非实时场景。
面试要点
- 难点:延迟、资源、运维、收益递减。
- 降成本:蒸馏成单模型、压缩子模型、选择性集成、共享底层、离线集成。
记忆要点
- 集成难点:延迟与资源放大、运维复杂、边际收益有限。
- 降成本:蒸馏、压缩、选择性集成、共享底层、离线集成。