SGL的自监督图学习,图结构增强(边丢弃、特征掩码)的有效性?
SGL (Self-supervised Graph Learning) 在图推荐模型(如 LightGCN)上引入自监督辅助任务:对同一图做多种增强得到不同视图,要求同一节点在不同视图下的表示一致、不同节点区分开,即典型的 contrastive learning。主任务仍是推荐(如 BPR),辅助任务为对比损失,二者联合训练,使嵌入既满足协同信号又具备更好的泛化与鲁棒性。
边丢弃 (edge dropout):随机以概率 $p$ 丢弃图中的边,得到稀疏子图;做两次独立边丢弃得到两个视图,同一节点在两个子图上的表示(经同一 GNN 编码)应接近。增强后的图仍保持局部结构,但迫使模型不过度依赖单条边,学到更稳健的表示。节点/特征掩码 (feature masking):随机将部分节点特征置零或加噪声,再经 GNN;两次独立掩码得到两视图。迫使模型利用邻居与结构补偿缺失特征,增强鲁棒性。形式化:视图 $\mathcal{G}_1, \mathcal{G}_2$ 由增强得到,$z_u^{(1)}, z_u^{(2)}$ 为节点 $u$ 在两视图的表示,对比损失(如 InfoNCE)为 \(\mathcal{L}_{ssl} = -\log \frac{\exp(z_u^{(1)\top} z_u^{(2)}/\tau)}{\sum_v \exp(z_u^{(1)\top} z_v^{(2)}/\tau)}.\)
边丢弃:相当于对结构的正则,防止过拟合少数强边;多视图对比要求「结构变化下表示稳定」,等价于学习结构不变的语义。特征掩码:类似 BERT 的 mask,利用上下文补全,增强对缺失/噪声的鲁棒性。二者结合能提升冷启动、长尾与稀疏场景下的表现,实验上 SGL 在多个基准上优于仅用 BPR 的 LightGCN。
| 返回模块 | 返回总览 |