sgr-interview-300

第 92 题:BERT4Rec的MLM预训练,推荐场景下的掩码比例调优?

题目

BERT4Rec的MLM预训练,推荐场景下的掩码比例调优?


完整讲解

一、BERT4Rec 的 MLM 预训练

BERT4Rec 用双向 Transformer 建模序列,通过 Masked Language Model (MLM) 预训练:随机将序列中比例 $p$ 的 item 替换为 [MASK],模型根据上下文预测被掩位置的原 item。损失为被掩位置上的交叉熵: \(\mathcal{L} = -\sum_{i \in \mathcal{M}} \ln P(v_i \mid \boldsymbol{S}_{\backslash \mathcal{M}}),\) 其中 $\mathcal{M}$ 为被掩位置集合,$\boldsymbol{S}_{\backslash \mathcal{M}}$ 为未掩的上下文。

二、推荐场景下的掩码比例

通用 NLP(如 BERT)常取 15% 左右;推荐序列通常更短、item 空间更大,需单独调优。

三、工程调优建议


面试要点


记忆要点

返回模块 返回总览