第 94 题:FDSA的特征级自注意力,物品属性与ID的联合编码?
题目
FDSA的特征级自注意力,物品属性与ID的联合编码?
完整讲解
一、FDSA 的特征级自注意力
FDSA(Feature-level Decomposed Self-Attention)在序列推荐中不仅用 item ID,还显式引入 item 属性(类目、品牌、标签等),并在特征维度上做自注意力分解。即对每个特征类型(如 ID、类目、品牌)分别做 self-attention,再融合,使模型同时利用「同一类目内的转移」「同一品牌内的转移」等模式。
二、物品属性与 ID 的联合编码
- 联合输入:将 ID 嵌入与各属性嵌入拼接或相加后作为序列中每步的表示,即 $\boldsymbol{x}t = \boldsymbol{e}{\text{id}} + \boldsymbol{e}{\text{cat}} + \boldsymbol{e}{\text{brand}}$(或拼接再投影),再送入自注意力。属性提供归纳偏置、缓解 ID 稀疏。
- 特征级注意力:对 ID、类目、品牌等分别建 attention 子层,各自做 Q/K/V 与 softmax,再对多路结果加权或拼接。这样可学到「类目内转移权重」「品牌内转移权重」等,可解释性更好。
- 共享与解耦:部分参数共享(如 value 投影)、部分解耦(如每类特征独立 key),在表达力与参数量间平衡。
三、工程要点
属性缺失时可用零向量或单独「缺失」嵌入;高基数属性需嵌入降维或哈希。联合编码后序列长度不变,主要增加每步的特征维度和 attention 头数,计算量随特征类型数近似线性增加。
面试要点
- 能说明 FDSA 在特征级做自注意力分解,ID 与属性(类目、品牌等)联合编码。
- 能说清联合输入(拼接/相加)与特征级分别 attention 再融合两种方式及优劣。
- 能提及属性缺失处理、高基数降维与计算量随特征类型增加。
记忆要点
- FDSA:特征级分解自注意力,ID + 属性(类目、品牌等)联合编码序列。
- 联合方式:拼接/相加输入 vs 每类特征单独 attention 再融合;后者可解释性更好。
- 属性缺失用零/缺失嵌入;高基数要降维;计算量随特征类型增加。