第 81 题:DSSM的语义匹配,词袋模型与深度语义表示的演进?
题目
DSSM的语义匹配,词袋模型与深度语义表示的演进?
完整讲解
一、词袋模型与语义局限
早期语义匹配多用词袋(BOW)或 TF-IDF:查询与文档表示为稀疏向量,相似度用余弦或内积。缺点:无词序、无语义——「苹果手机」与「手机苹果」完全同表示,与「香蕉」的相似度仅由共现决定,无法区分同义、多义与上下文。
二、DSSM 的深度语义表示
DSSM(Deep Structured Semantic Model)用深度网络将查询 $q$ 与文档 $d$ 分别映射到低维语义空间的向量 $\boldsymbol{u} = f(q)$、$\boldsymbol{v} = f(d)$,用语义向量的相似度(如余弦或内积)作为匹配分:
\(\text{sim}(q,d) = \frac{\boldsymbol{u}^\top \boldsymbol{v}}{\|\boldsymbol{u}\| \|\boldsymbol{v}\|},\quad \boldsymbol{u}=f(q),\ \boldsymbol{v}=f(d).\)
- 词袋到深度:输入可为 BOW 或字/词 n-gram 的向量,经多层 MLP 得到稠密表示;同一语义的多种表述被映射到相近向量,实现语义层面的匹配,而非字面匹配。
- 训练:用点击或标注数据,正样本 (q,d+) 相似度拉高、负样本 (q,d-) 相似度压低,损失常用 pairwise 交叉熵或 softmax over 候选。
三、演进与在推荐中的位置
- DSSM 奠定了「双塔 + 向量内积/余弦」的范式,后续双塔召回、向量检索均沿用:一侧用户/查询塔、一侧物品塔,离线算物品向量、在线算用户向量、ANN 检索。从 BOW 到 DSSM 是从稀疏字面到稠密语义的演进;再往后用 Transformer、序列建模等进一步强化语义与顺序信息。
面试要点
- 能说明 BOW 局限:无词序、无语义;DSSM 用深度网络将 query/doc 映射到语义空间,用向量相似度匹配。
- 能写出 DSSM 的相似度形式:$\boldsymbol{u}=f(q),\ \boldsymbol{v}=f(d)$,sim = 内积或余弦;训练用点击数据拉正压负。
- 能联系双塔召回与语义检索的演进:BOW → DSSM 语义向量 → 双塔 + ANN。
记忆要点
- BOW:稀疏、无序、无语义;DSSM:深度映射 $f(q),f(d)$,语义向量相似度匹配。
- DSSM:双塔雏形,pairwise/softmax 训练;演进为双塔召回 + ANN。
- 语义匹配 = 稠密语义空间中的向量相似度。