第 174 题:多样性重排序,MMR的参数调优与多样性度量?
题目
多样性重排序,MMR的参数调优与多样性度量?
完整讲解
一、多样性重排序的目标
初排往往按点击率/收益排序,易导致同质化(同一类物品扎堆)。多样性重排序:在保持相关性的前提下,增加结果在类别、主题、子类型上的分散度,提升体验与长期满意度。
二、MMR(Maximal Marginal Relevance)
- 公式:$MMR(i) = \lambda \cdot rel(i) - (1-\lambda) \max_{j \in S} sim(i,j)$,其中 $rel(i)$ 为物品 $i$ 与查询的相关性,$sim(i,j)$ 为与已选集合 $S$ 中物品的相似度。按 MMR 贪心选下一个物品:相关性高且与已选差异大的优先。
- 参数 $\lambda$:$\lambda$ 大更重相关性,$\lambda$ 小更重多样性;需用 A/B 或离线指标(如多样性、覆盖率、用户满意度)调优。
- 多样性度量:可用的有列表内平均相似度、类别熵、基尼分散度、ILAD(intra-list average distance)等;与 MMR 目标一致时可作监控或自动调参依据。
三、工程要点
- MMR 贪心为 $O(n^2)$($n$ 为候选数),可近似:限制与已选集合的比较数量、用聚类/代表点近似、或 DPP 等替代;相似度可用 embedding 余弦或类别层级。
面试要点
- 能写出 MMR 公式并说明 $\lambda$ 对相关性—多样性的调节作用。
- 能说清 MMR 的贪心选序逻辑及复杂度;能列举多样性度量(熵、ILAD、平均相似度)。
- 能简述 $\lambda$ 调优与工程近似(降复杂度、DPP 等)。
记忆要点
- MMR:$MMR = \lambda rel - (1-\lambda)\max sim$;贪心选相关性高且与已选差异大的物品。
- $\lambda$ 调参平衡相关与多样;多样性度量:熵、ILAD、平均相似度;工程可近似降复杂度。