sgr-interview-300

第 49 题:时间感知的注意力权重衰减,指数衰减 vs 可学习衰减函数?

题目

时间感知的注意力权重衰减,指数衰减 vs 可学习衰减函数?


完整讲解

一、时间感知注意力的动机

用户行为序列中,时间越近的行为往往与当前意图越相关;直接对历史做 attention 若不显式引入时间,模型只能从数据里隐式学时间偏好。时间感知的注意力在算权重时加入时间衰减,使近期行为天然获得更高权重或更高先验,提升可解释性与效果。

二、指数衰减

设行为时间戳为 ${t_1,\ldots,t_T}$,当前时间 $t_0$,时间差 $\Delta_t = t_0 - t_t$(或 $t_t - t_{t-1}$ 等)。指数衰减形式为 \(w_t^{time} = \exp(-\lambda \cdot \Delta_t),\quad a_t = \frac{w_t^{time} \cdot \exp(\text{score}(e_t, \boldsymbol{v}_A))}{\sum_j w_j^{time} \cdot \exp(\text{score}(e_j, \boldsymbol{v}_A))}.\) 即先对 attention score 乘上时间衰减 $w_t^{time}$ 再 softmax。$\lambda>0$ 为衰减率:$\lambda$ 大则远期行为权重快速趋近 0,更强调近期;$\lambda$ 小则衰减慢,中长期历史仍有用。优点:形式简单、可解释、超参少;缺点:衰减形式固定,无法随数据或用户变化。

三、可学习衰减函数

可学习衰减:用小型网络或参数化函数,以 $\Delta_t$(及可选的其他特征)为输入,输出标量权重 $w_t^{time} = f_\theta(\Delta_t)$,再与 content-based attention score 结合。例如 $f_\theta(\Delta_t) = \sigma(MLP([\Delta_t, \log(1+\Delta_t)]))$ 或学习一个非单调的「近期与某段中期都重要」的曲线。优点:可拟合复杂时间模式(如周期性、用户差异);缺点:需更多数据与正则,避免过拟合。实践中常采用「指数衰减 + 可学习缩放/偏置」的折中。


面试要点


记忆要点

返回模块 返回总览