题目
SSE-PT的个性化Transformer,用户嵌入与位置编码的融合?
完整讲解
一、SSE-PT 的个性化思路
SSE-PT(Stochastic Shared Embeddings for Parameter-efficient Transfer)在序列 Transformer 中引入用户级个性化:同一模型服务多用户,通过「用户嵌入」区分不同用户对同一序列的差异反应。序列输入为 item 嵌入 + 位置编码;用户信息通过用户嵌入注入,使同一序列在不同用户下得到不同表征。
二、用户嵌入与位置编码的融合方式
- 相加融合:$\boldsymbol{h}t = \boldsymbol{e}{v_t} + \boldsymbol{p}_t + \boldsymbol{e}_u$,将用户嵌入 $e_u$ 与 item 嵌入、位置编码 $p_t$ 直接相加后送进 Transformer。实现简单,但用户信息与位置在语义上混在一起。
- 门控/拼接后投影:如 $[\boldsymbol{e}_{v_t}; \boldsymbol{p}_t; \boldsymbol{e}_u]$ 经线性层再输入,或对用户嵌入做门控调制,可显式区分「谁」「在什么位置」「看了什么」。
- 分层注入:仅在部分层(如第一层或最后一层)加用户嵌入,或每层用可学习的门控融合用户向量,在表达力与参数效率间折中。
三、与位置编码的关系
位置编码提供「第几个」的序信息;用户嵌入提供「谁」的身份信息。二者同属加法型条件时,模型可学习到「某用户在某位置对某 item 的注意力」;若担心互相干扰,可采用分离注入(如用户只加在 [CLS]/最后一层)或门控融合,便于可解释性与调参。
面试要点
- 能说明 SSE-PT 用用户嵌入实现个性化、与 item/位置一起输入 Transformer。
- 能列举融合方式:直接相加、拼接/门控、分层注入,并说明各自优缺点。
- 能区分位置编码(序信息)与用户嵌入(身份信息),以及可选的门控/分层注入。
记忆要点
- SSE-PT:用户嵌入 + item 嵌入 + 位置编码一起输入 Transformer,实现个性化序列建模。
- 融合方式:相加简单、拼接/门控更可辨、分层注入省参数。
- 位置编码=序信息,用户嵌入=身份;可门控或分层注入减少干扰。