第 100 题:序列去噪,异常点击的检测与过滤机制?
题目
序列去噪,异常点击的检测与过滤机制?
完整讲解
一、序列去噪的必要性
用户行为序列中常含异常点击:误触、爬虫、刷量、兴趣漂移前的噪声等。若直接用于序列模型,会污染兴趣表征、拉低 next-item 或 CTR 预测效果,因此需要检测与过滤。
二、异常点击的检测
- 规则:极短停留(如 <1s)、重复连续点击同一 item、与历史兴趣明显偏离(如类目突变且无后续转化)。可用阈值或简单统计(停留时长分布、类目转移矩阵)筛出一部分。
- 模型:用二分类模型(正常/异常)对每个行为打分,特征可为:停留时长、与上一 item 的相似度、与用户长期兴趣的相似度、时间间隔、设备/环境特征。正样本为「正常行为」、负样本为人工标注或启发式规则构造的异常。
- 无监督:基于序列的重构误差或预测误差,异常点往往重构/预测差;或基于隔离森林、LOF 等对行为向量做异常检测。
三、过滤机制与工程
- 离线:在构建训练序列时,先跑检测模型或规则,将判为异常的行为剔除或降权(如不参与 loss、或权重 <1),再喂给序列模型。
- 在线:对实时序列同样做过滤后再做召回/排序;或对「可疑」行为不写入长期兴趣、只参与短期会话。
- 软过滤:不直接删,而是给每个行为一个可信度权重,在 attention 或 loss 中乘上该权重,异常行为权重接近 0,减少影响同时保留顺序信息。
四、注意点
- 过滤过猛会删掉真实但稀疏的长尾兴趣;建议保留「低置信异常」或做 A/B 看指标。
- 检测模型本身需定期用新样本更新,避免与当前分布漂移。
面试要点
- 能说明序列去噪的目的(异常点击污染兴趣、拉低效果)及检测思路:规则 + 模型 + 无监督。
- 能说清过滤机制:离线建序时剔除/降权、在线过滤或软权重复用。
- 能提及过猛过滤的风险与检测模型的更新。
记忆要点
- 异常点击:误触、爬虫、兴趣漂移噪声;检测用规则(停留、重复、类目突变)+ 模型/无监督。
- 过滤:离线剔除或降权、在线过滤;软过滤=可信度权重乘入 attention/loss。
- 避免过滤过猛伤及长尾兴趣;检测模型需随分布更新。