第 130 题:图像特征的迁移学习,CLIP嵌入的微调策略?
题目
图像特征的迁移学习,CLIP嵌入的微调策略?
完整讲解
一、图像特征与迁移学习
推荐中的图像特征(商品图、封面等)常用预训练视觉模型提取,再在推荐任务上微调或冻结使用,即迁移学习。CLIP(Contrastive Language-Image Pre-training)在图文对上做对比学习,得到统一的图像与文本嵌入空间,图像编码器可直接产出语义对齐的向量,适合跨模态检索与多模态推荐。
二、CLIP 嵌入的使用方式
- 冻结:直接使用官方或开源 CLIP 的图像编码器,对图像前向得到向量,作为特征输入推荐模型。优点:零训练、稳定;缺点:与推荐目标(点击、转化)未必对齐,领域差异大时效果有限。
- 微调:在推荐数据上对 CLIP 的图像编码器(或连同文本塔)做有监督或对比微调,使图像向量与点击/转化等信号对齐。可只微调顶层、或全量微调;需注意过拟合与数据量。
- 双塔:图像塔(CLIP 或微调 CLIP)与行为/ID 塔分别编码,用内积或 DNN 做匹配;微调时用点击/转化对做对比或 pointwise 损失。
三、微调策略
- 层级:先冻结 backbone、只训顶层(如投影层或分类头);再解冻部分层或全量微调;学习率通常 backbone 小、顶层大。
- 目标:与推荐主任务一致(CTR、CVR);或先做图文/图-行为对比再接任务头。负样本用 in-batch 或采样负例。
- 数据:用业务曝光/点击/转化数据;图像量不足时可结合公开图文数据做两阶段(先通用再领域)。
- 正则:微调时加 L2、或约束与预训练向量不要偏离太远(knowledge distillation),避免遗忘通用语义。
四、工程要点
- CLIP 推理成本较高,线上可离线算好图像嵌入建索引、线上只查向量;或用小模型蒸馏 CLIP 做线上编码。
- 与文本、ID 等多模态融合时,CLIP 嵌入可与其他嵌入拼接或做早期/晚期融合(见向量检索题)。
面试要点
- 能说明 CLIP 图像嵌入在推荐中的迁移方式:冻结 vs 微调,以及微调的目的(与点击/转化对齐)。
- 能说清微调策略:层级解冻、学习率、目标(CTR/CVR 或对比)、数据与正则。
- 能提及离线预计算嵌入、蒸馏以降低线上成本,以及与多模态融合。
记忆要点
- CLIP 嵌入:冻结=零训练稳定;微调=与推荐目标对齐,可只训顶层或全量。
- 微调:层级解冻、backbone 小 lr、目标与主任务一致、负样本与正则。
- 线上可离线算嵌入或蒸馏;与文本/ID 多模态融合。