第 169 题:广告欺诈检测,异常点击模式的实时识别?
题目
广告欺诈检测,异常点击模式的实时识别?
完整讲解
一、广告欺诈与异常点击
广告欺诈:通过虚假点击、展示或转化骗取分成或消耗广告主预算(如刷量、点击农场、僵尸流量)。异常点击:在时间、地域、设备、行为模式上明显偏离正常分布的点击,常作为欺诈的代理信号。
二、异常模式的实时识别
- 特征:点击率异常高、重复 IP/设备、短时间密集点击、地域/时段与历史不符、无后续转化、与展示量不匹配等;可做规则引擎(阈值、黑名单)与模型(分类/异常检测)结合。
- 实时性:在点击上报或计费前做实时过滤(毫秒级):规则匹配、轻量模型推理、设备/IP 画像与图关系;延迟高时可先放行再异步扣费或赔付。
- 模型:用历史标注(已知作弊/正常)训练二分类或异常检测(如 Isolation Forest、自编码器);在线用特征拼接 + 模型打分,高于阈值则拦截或降权。
三、工程要点
- 特征管道低延迟、模型定期更新;黑名单与图扩散(关联设备/IP)提高召回;需平衡误杀与漏杀(误杀损收入、漏杀损信任)。
面试要点
- 能说清广告欺诈类型(虚假点击、刷量)及异常点击的典型特征(CTR、IP/设备、时序、转化)。
- 能描述实时识别链路:规则 + 模型、特征、阈值与黑名单;延迟约束下的实时 vs 异步处理。
- 能列举模型与工程手段:分类/异常检测、图扩散、误杀与漏杀权衡。
记忆要点
- 欺诈:虚假点击/刷量;异常点击特征:CTR、IP/设备、时序、转化异常。
- 实时识别:规则+模型、黑名单、图扩散;平衡误杀与漏杀,特征与模型低延迟。