sgr-interview-300

第 48 题:HSTU的块级因果注意力,生成式推荐的新范式挑战?

题目

HSTU的块级因果注意力,生成式推荐的新范式挑战?


完整讲解

一、生成式推荐与因果注意力

生成式推荐(如下一项生成、序列生成)需要自回归地预测下一个 token/item,因此对历史序列必须用 因果(单向)注意力:位置 $t$ 只能看到 $1,\ldots,t$,不能看到 $t+1,\ldots,L$,否则会信息泄露。标准做法是 attention 矩阵加 causal mask,得到下三角注意力权重。

二、HSTU 的块级因果注意力

块级(chunk-wise)因果注意力把序列切成若干块,块内做完整 self-attention(块内无因果限制),块间做因果:当前块只能 attend 到当前块及之前块。即注意力矩阵按块分块,下三角块可 attend,上三角块 mask 掉。这样在块内可并行、长程依赖通过「块与块」的因果传递建模,相比逐 token 因果 attention 计算更高效(块内无 mask,GPU 友好),同时满足自回归因果性。

三、生成式推荐的新范式与挑战

新范式:从「判别式 CTR/CVR」转向「生成式序列生成」——给定历史,生成下一项或整个序列;模型可做检索、重排序、多样性生成。挑战:(1)评估:BLEU/NDCG 等与业务指标不完全一致,需定义生成质量与多样性指标;(2)解码:自回归解码慢,需要 chunk 并行、非自回归或蒸馏;(3)可控性:如何注入约束(如类目、长度、多样性);(4)与检索结合:生成式常与检索混合(retrieve-then-generate)。块级因果注意力是生成式架构里兼顾效率与因果约束的一种典型设计。


面试要点


记忆要点

返回模块 返回总览