第 119 题:多模态向量融合,早期融合 vs 晚期融合的精度差异?
题目
多模态向量融合,早期融合 vs 晚期融合的精度差异?
完整讲解
一、多模态向量与融合
多模态检索中,同一实体有文本嵌入 $\boldsymbol{v}_t$、图像嵌入 $\boldsymbol{v}_i$ 等。检索时 query 可能为文本或图像,需与底库的多种模态对齐。融合指如何将多路向量合并成单一表示用于索引与距离计算,或如何在检索阶段联合多路相似度。
二、早期融合(Early Fusion)
- 做法:在特征/向量层面先融合,再建索引与检索。例如 $\boldsymbol{v} = [\boldsymbol{v}_t; \boldsymbol{v}_i]$ 拼接后做一次投影 $\boldsymbol{W}[\boldsymbol{v}_t; \boldsymbol{v}_i]$,或 $\boldsymbol{v}_t + \boldsymbol{v}_i$ 得到单向量,再用单向量建 ANN 索引、query 同样融合后查一次。
- 优点:只建一个索引、一次检索;多模态信息在表示里已交互,理论上有更强表征。
- 缺点:若模态缺失(如只有图无文)需补零或单独分支;融合方式(拼接/相加/门控)与投影需训练;索引对「融合后分布」敏感,某一模态主导时另一模态可能被压制,精度依赖融合质量与数据平衡。
三、晚期融合(Late Fusion)
- 做法:各模态分别建索引、分别检索得到 Top-K 列表,再在分数层面融合(如加权和、RRF、或学习融合模型)得到最终排序。
- 优点:各模态独立、可单独调参与扩展;缺模态时只查有数据的模态;实现简单、易做 A/B。
- 缺点:要维护多套索引、多次检索,延迟与资源翻倍(量级上);早期无跨模态交互,仅靠分数融合,表达上限可能不如早期;若两路排序差异大,简单加权可能不稳定,需 RRF 或学习融合。
四、精度差异与选型
- 精度:早期融合在「多模态对齐好、融合训练充分」时,单向量表达更丰富,上限可更高;晚期融合无表示层交互,但可针对每路做专门优化(如文本用 BERT、图像用 CLIP),两路都强时分数融合也能很好。实际谁更准取决于数据与训练。
- 选型:强对齐、单向量检索为主、资源允许单大索引时倾向早期;多模态可缺、要灵活扩展、或延迟敏感时倾向晚期或混合(部分早期 + 部分晚期再融合)。
面试要点
- 能区分早期融合(特征/向量先合并、单索引单次检索)与晚期融合(多路分别检索、分数融合)。
- 能分析早期优点(单索引、表示可更强)与缺点(缺模态处理、融合质量敏感);晚期优点(灵活、可缺模态)与缺点(多索引、多次检索、无表示交互)。
- 能说清精度谁高取决于数据与训练;选型看对齐程度、资源与延迟、是否缺模态。
记忆要点
- 早期融合:向量先合并→单索引单次检索;晚期融合:多路分别检索→分数融合(加权/RRF)。
- 早期:单索引、表示可更强,但缺模态与融合质量敏感;晚期:灵活、可缺模态,但多路检索、无表示交互。
- 精度看数据与训练;选型看对齐、资源、缺模态情况。