研究对抗样本的生成机理与检测方法,探索对抗训练、输入净化、认证防御、扩散模型去噪等防御技术,覆盖图像、文本、音频、多模态等全场景。
对抗样本(Adversarial Examples)是指在原始输入上添加人眼难以察觉的微小扰动,即可导致深度学习模型产生错误输出的样本。自Szegedy等人(ICLR 2014)首次发现该现象、Goodfellow等人(ICLR 2015)提出FGSM攻击以来,这一领域揭示了神经网络的根本脆弱性:模型学到的"决策边界"并非人类可理解的语义边界,而是高维空间中复杂的非线性曲面。
对抗样本威胁已从学术研究走向现实应用:自动驾驶中的对抗性贴纸可误导交通标志识别(Eykholt et al., CVPR 2018);对抗性眼镜可绕过人脸识别(Sharif et al., CCS 2016);对抗性音频可在人耳无感的情况下劫持语音助手(Carlini et al., 2016);在内容审核与多模态大模型场景中,对抗性输入可规避有害内容检测。随着多模态大模型与AI Agent的普及,跨模态对抗攻击成为新兴威胁向量。
核心洞察:对抗样本的本质是模型"语义理解"与"统计关联"之间的鸿沟——模型依赖的统计特征与人类理解的语义特征并不一致,攻击者利用这一差距构造误导性输入。防御的终极目标是让模型的决策对齐人类语义,而非仅提升某一攻击下的指标。
攻击者完全了解模型架构与参数,利用梯度信息生成对抗样本。代表方法:FGSM(Goodfellow et al., ICLR 2015)、PGD(Madry et al., ICLR 2018)、C&W攻击(Carlini & Wagner, IEEE S&P 2017)。白盒攻击成功率通常接近100%,是评估模型鲁棒性的"压力测试"基准。
攻击者仅能通过API查询获取模型输出,利用迁移攻击(基于替代模型生成对抗样本)或查询攻击(基于查询反馈优化扰动)。黑盒攻击更贴近现实威胁场景;迁移性研究表明白盒防御若评估不当会高估鲁棒性。
将对抗扰动从数字空间映射到物理世界:对抗性贴纸与补丁(Brown et al., NeurIPS 2017)、3D打印物体、对抗性眼镜(CCS 2016)、交通标志涂鸦(CVPR 2018)。光照、角度、距离的变化增加了攻击难度,但多次现场实验已证明其可行性。
针对视觉-语言模型(VLM)与CLIP类模型的跨模态攻击:排版攻击(在图像中添加对抗性文本改变分类)、对抗性图像诱导文本模型生成错误描述、对抗性提示注入多模态Agent。多模态模型的复杂交互面显著扩大了攻击面。
TextFooler(Jin et al., ACL 2020):基于词重要性排序与同义词替换,在保持语义与语法的前提下误导文本分类器;BERT-Attack(Li et al., EMNLP 2020):利用掩码语言模型生成上下文感知的扰动。威胁场景:情感分析操纵、垃圾邮件绕过、内容审核规避、假新闻检测规避。
Hidden Voice Commands(Carlini et al., 2016):对人耳不可闻的语音指令唤醒并操控设备;CommanderSong(Yuan et al., USENIX Security 2018):将恶意命令"唱"进歌曲中。威胁场景:智能音箱、车载语音、声纹验证系统。
排版攻击(typographic attacks)证明CLIP类模型对图像中的对抗性文本高度敏感;多模态大模型还可能遭受跨模态提示注入(图像中嵌入恶意指令文本)。威胁场景:多模态内容审核绕过、具身智能指令劫持。
对抗性补丁可让人工"隐身"于检测器(Brown et al., NeurIPS 2017);眼镜框图案可冒充他人通过人脸识别(Sharif et al., CCS 2016);交通标志上的贴纸可使自动驾驶系统将Stop识别为限速(Eykholt et al., CVPR 2018)。这些工作直接推动了物理鲁棒性评估标准(如AutoAttack的物理扩展)的发展。
1. 对抗训练(Adversarial Training)
在训练过程中将对抗样本纳入训练集,使模型学习对扰动的鲁棒性。PGD-based对抗训练(Madry et al., ICLR 2018)是当前最广泛采用的方法,但存在训练成本高、干净准确率下降、对未见攻击类型泛化不足等问题。TRADES(Zhang et al., ICML 2019)与MART(Wang et al., ICLR 2020)在鲁棒性与准确率之间寻求更好平衡,其中TRADES以鲁棒损失与干净损失的加权 trade-off 形式成为后续工作的基准。
2. 输入净化(Input Purification)
在推理阶段对输入进行预处理以消除对抗扰动:JPEG压缩与特征压缩(Xu et al., NDSS 2018)、像素偏转、随机化变换等。扩散模型(Diffusion Models)作为去噪器展现出强大潜力:DiffPure(Nie et al., ICML 2022)通过前向加噪与反向去噪过程有效"净化"对抗扰动同时保留语义信息,成为该方向的代表性方法。
3. 认证防御(Certified Defense)
提供可证明的鲁棒性保证:对于给定输入,在L_p范数球内的所有扰动均不会改变模型输出。Randomized Smoothing(Cohen et al., ICML 2019)通过高斯噪声平滑分类器,是当前最主流的认证防御方法,可将任意基础分类器转化为具有概率性鲁棒认证的平滑分类器。
4. 检测与预警
训练专门的对抗样本检测器:局部内在维度LID分析(Ma et al., ICLR 2018,利用对抗样本的隐层表示几何特性)、Feature Squeezing(Xu et al., NDSS 2018,比较原始输入与压缩输入的预测差异)、激活模式分析、输入重构误差检测等。检测方法应与净化/认证方法组合使用,而非单独依赖。
| 应用场景 | 攻击风险 | 防御需求 | 成熟度 |
|---|---|---|---|
| 自动驾驶 | 交通标志误识别、障碍物忽略(CVPR 2018物理攻击已验证) | 物理世界鲁棒性、传感器融合冗余、实时认证 | 研究中 |
| 人脸识别/门禁 | 身份冒用、系统绕过(CCS 2016眼镜攻击) | 活体检测增强、多模态(红外/深度)融合、对抗训练 | 初步部署 |
| 内容审核 | 有害内容规避检测(文本对抗、排版攻击) | 多模态对抗训练、输入净化、意图级审核 | 研究中 |
| 医疗影像 | 病灶误识别、诊断错误 | 高置信度认证、人在回路(医生复核)、扰动可视化告警 | 高风险 |
| 金融风控 | 欺诈交易特征扰动绕过检测 | 表格数据对抗训练、特征级异常检测、规则兜底 | 探索中 |
| 智能语音/声纹 | 不可闻指令劫持、合成语音通过验证 | 活体声纹、频谱异常检测、多通道一致性校验 | 研究中 |