第 186 题:垃圾信息的过滤,对抗性样本的防御?
题目
垃圾信息的过滤,对抗性样本的防御?
完整讲解
一、垃圾信息与过滤目标
垃圾信息:营销骚扰、诈骗、恶意推广、机器人刷屏等,损害体验与信任。过滤:用规则与模型在发布/展示前识别并拦截或降权,减少触达。
二、对抗性样本与攻击
- 对抗性样本:攻击者针对模型刻意构造的输入(如轻微改字、同音替换、插入不可见字符),使模型误判为正常,从而绕过过滤。
- 常见攻击:文本上同义词替换、错别字、插入空格/标点、对抗性扰动;图像上微小扰动导致分类翻转。攻击者可能利用模型梯度(白盒)或仅靠查询反馈(黑盒)迭代优化对抗样本。
三、防御思路
- 数据与训练:加入对抗样本或对抗训练(在 loss 中优化 worst-case 扰动),提升对扰动的鲁棒性;数据增强(同义替换、回译、噪声)扩大分布。
- 模型与结构:集成多模型、多特征(规则+模型),单点被攻破不致命;输入规范化(去噪、标准化、长度限制)减少攻击面。
- 行为与频率:结合行为与频率(发帖频率、账号年龄、历史违规)做二次判断,对抗样本多来自新号或机器;人机识别与限流。
- 持续迭代:收集绕过 case、标注后重训;黑名单与规则快速止血,模型负责泛化。
面试要点
- 能说清垃圾信息类型与过滤目标;能解释对抗性样本(刻意构造以绕过模型)。
- 能列举防御:对抗训练/数据增强、多模型与规则、输入规范化、行为与频率、持续迭代。
- 能简述攻击方式(文本同义/扰动、黑盒查询)与防御的权衡(鲁棒性 vs 误杀)。
记忆要点
- 垃圾信息过滤易遭对抗样本攻击;防御=对抗训练与数据增强、规则+模型、行为/频率、持续迭代。
- 攻击:同义/扰动/黑盒;防御需平衡鲁棒性与误杀。