对抗样本防御

研究对抗样本的生成机理与检测方法,探索对抗训练、输入净化、认证防御、扩散模型去噪等防御技术,覆盖图像、文本、音频、多模态等全场景。

研究背景与意义

对抗样本(Adversarial Examples)是指在原始输入上添加人眼难以察觉的微小扰动,即可导致深度学习模型产生错误输出的样本。自Szegedy等人(ICLR 2014)首次发现该现象、Goodfellow等人(ICLR 2015)提出FGSM攻击以来,这一领域揭示了神经网络的根本脆弱性:模型学到的"决策边界"并非人类可理解的语义边界,而是高维空间中复杂的非线性曲面。

对抗样本威胁已从学术研究走向现实应用:自动驾驶中的对抗性贴纸可误导交通标志识别(Eykholt et al., CVPR 2018);对抗性眼镜可绕过人脸识别(Sharif et al., CCS 2016);对抗性音频可在人耳无感的情况下劫持语音助手(Carlini et al., 2016);在内容审核与多模态大模型场景中,对抗性输入可规避有害内容检测。随着多模态大模型与AI Agent的普及,跨模态对抗攻击成为新兴威胁向量。

核心洞察:对抗样本的本质是模型"语义理解"与"统计关联"之间的鸿沟——模型依赖的统计特征与人类理解的语义特征并不一致,攻击者利用这一差距构造误导性输入。防御的终极目标是让模型的决策对齐人类语义,而非仅提升某一攻击下的指标。

攻击方法分类

① 白盒攻击

攻击者完全了解模型架构与参数,利用梯度信息生成对抗样本。代表方法:FGSM(Goodfellow et al., ICLR 2015)、PGD(Madry et al., ICLR 2018)、C&W攻击(Carlini & Wagner, IEEE S&P 2017)。白盒攻击成功率通常接近100%,是评估模型鲁棒性的"压力测试"基准。

② 黑盒攻击

攻击者仅能通过API查询获取模型输出,利用迁移攻击(基于替代模型生成对抗样本)或查询攻击(基于查询反馈优化扰动)。黑盒攻击更贴近现实威胁场景;迁移性研究表明白盒防御若评估不当会高估鲁棒性。

③ 物理世界攻击

将对抗扰动从数字空间映射到物理世界:对抗性贴纸与补丁(Brown et al., NeurIPS 2017)、3D打印物体、对抗性眼镜(CCS 2016)、交通标志涂鸦(CVPR 2018)。光照、角度、距离的变化增加了攻击难度,但多次现场实验已证明其可行性。

④ 多模态对抗

针对视觉-语言模型(VLM)与CLIP类模型的跨模态攻击:排版攻击(在图像中添加对抗性文本改变分类)、对抗性图像诱导文本模型生成错误描述、对抗性提示注入多模态Agent。多模态模型的复杂交互面显著扩大了攻击面。

跨模态对抗攻击:文本、音频与多模态

① 文本对抗攻击

TextFooler(Jin et al., ACL 2020):基于词重要性排序与同义词替换,在保持语义与语法的前提下误导文本分类器;BERT-Attack(Li et al., EMNLP 2020):利用掩码语言模型生成上下文感知的扰动。威胁场景:情感分析操纵、垃圾邮件绕过、内容审核规避、假新闻检测规避。

② 音频对抗攻击

Hidden Voice Commands(Carlini et al., 2016):对人耳不可闻的语音指令唤醒并操控设备;CommanderSong(Yuan et al., USENIX Security 2018):将恶意命令"唱"进歌曲中。威胁场景:智能音箱、车载语音、声纹验证系统。

③ 多模态与VLM攻击

排版攻击(typographic attacks)证明CLIP类模型对图像中的对抗性文本高度敏感;多模态大模型还可能遭受跨模态提示注入(图像中嵌入恶意指令文本)。威胁场景:多模态内容审核绕过、具身智能指令劫持。

④ 物理世界攻击实例

对抗性补丁可让人工"隐身"于检测器(Brown et al., NeurIPS 2017);眼镜框图案可冒充他人通过人脸识别(Sharif et al., CCS 2016);交通标志上的贴纸可使自动驾驶系统将Stop识别为限速(Eykholt et al., CVPR 2018)。这些工作直接推动了物理鲁棒性评估标准(如AutoAttack的物理扩展)的发展。

防御技术体系

1. 对抗训练(Adversarial Training)

在训练过程中将对抗样本纳入训练集,使模型学习对扰动的鲁棒性。PGD-based对抗训练(Madry et al., ICLR 2018)是当前最广泛采用的方法,但存在训练成本高、干净准确率下降、对未见攻击类型泛化不足等问题。TRADES(Zhang et al., ICML 2019)与MART(Wang et al., ICLR 2020)在鲁棒性与准确率之间寻求更好平衡,其中TRADES以鲁棒损失与干净损失的加权 trade-off 形式成为后续工作的基准。

2. 输入净化(Input Purification)

在推理阶段对输入进行预处理以消除对抗扰动:JPEG压缩与特征压缩(Xu et al., NDSS 2018)、像素偏转、随机化变换等。扩散模型(Diffusion Models)作为去噪器展现出强大潜力:DiffPure(Nie et al., ICML 2022)通过前向加噪与反向去噪过程有效"净化"对抗扰动同时保留语义信息,成为该方向的代表性方法。

3. 认证防御(Certified Defense)

提供可证明的鲁棒性保证:对于给定输入,在L_p范数球内的所有扰动均不会改变模型输出。Randomized Smoothing(Cohen et al., ICML 2019)通过高斯噪声平滑分类器,是当前最主流的认证防御方法,可将任意基础分类器转化为具有概率性鲁棒认证的平滑分类器。

4. 检测与预警

训练专门的对抗样本检测器:局部内在维度LID分析(Ma et al., ICLR 2018,利用对抗样本的隐层表示几何特性)、Feature Squeezing(Xu et al., NDSS 2018,比较原始输入与压缩输入的预测差异)、激活模式分析、输入重构误差检测等。检测方法应与净化/认证方法组合使用,而非单独依赖。

⚠ 评估方法论的警示:Athalye等人(ICML 2018, "Obfuscated Gradients Give a False Sense of Security")系统揭示了若干防御被"梯度掩蔽"(gradient masking)虚增鲁棒性的现象——攻击者使用正确的自适应攻击后防御即告失效。此后业界形成共识:鲁棒性评估必须使用AutoAttack(Croce & Hein, ICML 2020)等强自适应攻击基准,并在RobustBench(Croce et al., JMLR 2021)等公开排行榜上接受第三方检验。

评估指标与公开基准

  • 鲁棒准确率(Robust Accuracy):在PGD、AutoAttack等强攻击下仍正确的样本比例——目前对抗训练模型在CIFAR-10 L∞ ε=8/255下的SOTA鲁棒准确率约为60%量级(截至RobustBench榜单),距离实用仍有显著差距;
  • AutoAttack(ICML 2020):无参数、多样化攻击集成,已成为鲁棒性评估的事实标准——通过AutoAttack检验是防御被学界认可的前提;
  • RobustBench(JMLR 2021):标准化模型、攻击与数据集的鲁棒性排行榜,覆盖L2/L∞及常见corruption;
  • 认证半径(Certified Radius):Randomized Smoothing类方法报告的可达认证半径,以及其对干净准确率的折损;
  • 物理世界评估:需在多变光照、距离、角度下端到端测试,实验室数字指标不能直接外推。

应用场景与风险评估

应用场景攻击风险防御需求成熟度
自动驾驶 交通标志误识别、障碍物忽略(CVPR 2018物理攻击已验证) 物理世界鲁棒性、传感器融合冗余、实时认证 研究中
人脸识别/门禁 身份冒用、系统绕过(CCS 2016眼镜攻击) 活体检测增强、多模态(红外/深度)融合、对抗训练 初步部署
内容审核 有害内容规避检测(文本对抗、排版攻击) 多模态对抗训练、输入净化、意图级审核 研究中
医疗影像 病灶误识别、诊断错误 高置信度认证、人在回路(医生复核)、扰动可视化告警 高风险
金融风控 欺诈交易特征扰动绕过检测 表格数据对抗训练、特征级异常检测、规则兜底 探索中
智能语音/声纹 不可闻指令劫持、合成语音通过验证 活体声纹、频谱异常检测、多通道一致性校验 研究中

参考来源(真实文献, venues与年份经核实)

[1]Szegedy C. et al. Intriguing Properties of Neural Networks. ICLR 2014(对抗样本首次提出).
[2]Goodfellow I.J., Shlens J., Szegedy C. Explaining and Harnessing Adversarial Examples. ICLR 2015(FGSM).
[3]Madry A. et al. Towards Deep Learning Models Resistant to Adversarial Attacks. ICLR 2018(PGD对抗训练).
[4]Carlini N., Wagner D. Towards Evaluating the Robustness of Neural Networks. IEEE S&P 2017(C&W攻击).
[5]Cohen J., Rosenfeld E., Kolter Z. Certified Adversarial Robustness via Randomized Smoothing. ICML 2019.
[6]Nie W. et al. Diffusion Models for Adversarial Purification. ICML 2022(DiffPure).
[7]Athalye A., Carlini N., Wagner D. Obfuscated Gradients Give a False Sense of Security: Circumventing Defenses to Adversarial Examples. ICML 2018.
[8]Croce F., Hein M. Reliable Evaluation of Adversarial Robustness with an Ensemble of Diverse Parameter-free Attacks (AutoAttack). ICML 2020.
[9]Croce F. et al. Evaluating the Adversarial Robustness of Adaptive Test-time Defenses (RobustBench). JMLR 2021.
[10]Zhang H. et al. Theoretically Principled Trade-off between Robustness and Accuracy (TRADES). ICML 2019;Wang Y. et al. Improving Adversarial Robustness Requires Revisiting Misclassified Examples (MART). ICLR 2020.
[11]Ma X. et al. Characterizing Adversarial Subspaces Using Local Intrinsic Dimensionality. ICLR 2018;Xu W. et al. Feature Squeezing: Detecting Adversarial Examples in Deep Neural Networks. NDSS 2018.
[12]Jin D. et al. Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment (TextFooler). AAAI 2020;Li L. et al. BERT-Attack: Adversarial Attack Against BERT Using BERT. EMNLP 2020.
[13]Carlini N. et al. Hidden Voice Commands. USENIX Security 2016;Yuan X. et al. CommanderSong: A Systematic Approach for Practical Adversarial Voice Recognition. USENIX Security 2018.
[14]Sharif M. et al. Accessorize to a Crime: Real and Stealthy Attacks on State-of-the-Art Face Recognition. CCS 2016;Eykholt K. et al. Robust Physical-World Attacks on Deep Learning Models. CVPR 2018;Brown T.B. et al. Adversarial Patch. NeurIPS 2017.
← 返回AI驱动安全总览