第 248 题:推荐预训练任务,MLM与对比学习的联合?
题目
推荐预训练任务,MLM与对比学习的联合?
完整讲解
一、推荐预训练任务
- 预训练:在大量无标注或弱标注数据上学习通用表示,再在下游推荐任务上微调。推荐场景可用的自监督任务包括 MLM(掩码语言模型) 与 对比学习,二者可联合以兼顾语义与序列/行为表示。
二、MLM 在推荐中的形式
- 文本 MLM:对 item 标题、描述、标签等做随机 mask,模型预测被 mask 的 token,学习文本表示与实体语义,便于后续文本匹配与理解。
- 行为/序列 MLM:将行为序列视为「句子」,随机 mask 部分 item 或位置,预测被 mask 的 item 或下一行为,学习序列与协同信号;可与 BERT4Rec、SASRec 等思路结合。
三、对比学习
- 目标:拉近正对(如同一 user 的两次增强视图、同 session 内共现 item)、推远负对,学习区分性表示。常用 InfoNCE 或 NT-Xent。
- 推荐应用:user-item 对、序列增强(crop、mask、reorder)后对比;多模态时图文对齐也是对比;可得到 user/item 向量用于检索与排序。
- 联合:同一模型可同时做 MLM 损失与对比损失(多任务),MLM 强语义、对比强区分与对齐;需平衡损失权重与负样本构造。
面试要点
- 能说清推荐预训练中 MLM 的两种形态:文本 MLM 与行为/序列 MLM。
- 能说明对比学习的目标与在推荐中的应用(user-item、序列增强、多模态),以及 MLM+对比联合训练的意义与权重平衡。
记忆要点
- 推荐预训练:MLM(文本+行为序列)+ 对比学习;MLM 强语义,对比强区分与对齐。
- 联合训练时平衡两损失与负样本构造;预训练表示用于下游微调。