UltraGCN的约束损失,直接学习邻接矩阵的收敛性分析?
UltraGCN 认为显式的多层消息传递(如 GCN/NGCF)会带来过平滑与高计算量,因此去掉消息传递,直接对嵌入施加与图结构一致的约束:希望「有边相连的节点」嵌入更相似、「无边」的节点更不相似。即把「图结构」转化为损失中的约束,通过优化损失间接学到符合邻接关系的嵌入,而不经过显式 $A H^{(l)}$ 的传播。
设邻接矩阵 $A$(或带权),正样本对 $(u,i) \in \mathcal{E}^+$,负样本对从无边节点中采样 $\mathcal{E}^-$。约束损失可写为 \(\mathcal{L} = -\sum_{(u,i)\in\mathcal{E}^+} \log \sigma(\boldsymbol{e}_u^\top \boldsymbol{e}_i / \tau) - \sum_{(u,j)\in\mathcal{E}^-} \log \sigma(-\boldsymbol{e}_u^\top \boldsymbol{e}_j / \tau) + \lambda \|\Theta\|^2.\) 即 BPR/InfoNCE 形式的对比损失:正对拉近、负对推远;$\tau$ 为温度。可选地加入二阶约束:若 $u$ 与 $i$、$i$ 与 $j$ 都有边,则希望 $u$ 与 $j$ 在嵌入空间也较近,通过多跳正样本或额外项实现,从而隐式利用高阶结构,而无需显式多层 GCN。
在理想情况下,若负样本充分、优化收敛,最小化上述损失会使 $\boldsymbol{e}_u^\top \boldsymbol{e}_i$ 对有边 $(u,i)$ 较大、对无边较小,即嵌入满足「邻接 ≈ 相似」。收敛性依赖:损失凸性(在嵌入空间非凸,但相对平滑);负采样质量与数量;学习率与正则。原论文通过实验表明:不做过消息传递、仅约束损失即可达到或超过多轮 GCN 的效果,且训练更快、超参更少,从侧面说明「约束式」学习的有效性。
| 返回模块 | 返回总览 |