第 129 题:文本特征的提取,BERT嵌入 vs TF-IDF的适用场景?
题目
文本特征的提取,BERT嵌入 vs TF-IDF的适用场景?
完整讲解
一、文本特征在推荐中的角色
标题、描述、评论、搜索词等文本需转为数值特征供排序/召回使用。常见有两类:TF-IDF(或 BM25)的稀疏向量表示,与 BERT 等预训练模型的稠密嵌入。二者适用场景不同。
二、TF-IDF 的适用场景
- 做法:词频 TF × 逆文档频率 IDF,得到词权重;文档表示为稀疏向量(词袋或 n-gram),可用于检索(与 query 做内积/余弦)、或作为特征输入模型。
- 优点:无需训练、可解释、对关键词与精确匹配敏感;检索场景下与倒排结合好、可做 BM25 排序;资源占用小。
- 缺点:稀疏高维、无语义(同义不同词不匹配);长文本向量维度过大;不适合直接做复杂语义相似或深度模型的主输入(需配合降维或仅作一路特征)。
- 适用:关键词检索、冷启动(无行为时用文本匹配)、可解释性要求高、资源受限;或作为多路特征中的一路与 BERT 融合。
三、BERT 嵌入的适用场景
- 做法:用 BERT(或 Sentence-BERT、SimCSE 等)对句子/段落编码得到稠密向量(如 768 维),用于相似度计算、检索、或拼入排序模型。
- 优点:语义强、同义与 paraphrasing 可对齐;稠密低维、便于与其它嵌入联合建模;预训练后可微调适配领域。
- 缺点:计算与显存开销大;需 GPU/优化才能满足线上延迟;长文本需截断或分块。
- 适用:语义召回、语义相似度排序、多模态对齐(与图像 CLIP 等);有足够算力与延迟预算时作为主文本表示。
四、选型与融合
- 检索主链路、要语义:BERT 嵌入 + 向量索引;或 BERT 粗排 + 精排。
- 关键词与可解释、或冷启动:TF-IDF/BM25 一路,与 BERT 分数或特征融合。
- 资源紧:TF-IDF 或轻量 sentence 模型(如蒸馏后的 BERT);或离线算 BERT 嵌入建索引、线上只做检索。
面试要点
- 能说明 TF-IDF 与 BERT 嵌入各自形式(稀疏词权 vs 稠密向量)及优缺点。
- 能说清 TF-IDF 适合检索/关键词/冷启动/可解释、BERT 适合语义/相似度/排序主输入。
- 能根据算力、延迟、业务需求选型或融合(双路检索、特征拼接等)。
记忆要点
- TF-IDF:稀疏、无训练、关键词敏感;适合检索、冷启动、可解释、资源紧。
- BERT 嵌入:稠密、语义强;适合语义召回与排序、有算力时;开销大、长文本需截断。
- 融合:双路检索或特征拼接;按算力与需求选主路与辅助路。