机器学习模型安全

研究模型窃取、成员推断、模型逆向等隐私攻击,以及数据投毒、后门植入、权重篡改等完整性威胁,构建模型全生命周期安全评估体系。

研究背景与意义

机器学习模型正成为企业核心数字资产。从金融风控到医疗诊断,从自动驾驶到内容审核,模型的决策直接影响业务安全与用户权益。然而,模型的"黑箱"特性与"数据驱动"本质使其面临独特的安全威胁:攻击者无需访问训练数据即可窃取模型功能、推断训练集成员,通过精心构造的输入即可操控模型输出,在训练阶段植入的后门可在部署后静默激活。

模型供应链安全形势尤为严峻。Hugging Face平台托管模型数量于2025年突破100万个,安全审核主要依赖平台扫描与社区举报;EvilModel研究(USENIX Security 2021)早已证明恶意载荷可隐写进模型权重本身,MITRE ATLAS亦收录了真实案例(攻击者上传含反向shell代码的pickle格式恶意模型)。2026年3月的LiteLLM事件(TeamPCP经被攻陷的CI凭证向PyPI投毒)再次警示:AI工程链路中的任何一环都可能成为攻击入口。

核心洞察:模型安全不仅是技术问题,更是供应链治理问题——从训练数据、模型权重、微调数据集到部署模板,每个环节都可能成为攻击入口;且大模型的"记忆化"特性使训练数据泄露成为新型隐私风险(Carlini et al., USENIX Security 2021)。

攻击面全景分析

① 隐私攻击:窃取与推断

模型窃取(Tramèr et al., USENIX Security 2016:经预测API抽取等价模型);成员推断(Shokri et al., IEEE S&P 2017:判断数据是否在训练集中);模型逆向(Fredrikson et al., CCS 2015:从置信度输出重建训练样本特征);大模型数据提取(Carlini et al., USENIX Security 2021:从GPT-2提取出真实个人隐私文本)。

② 完整性攻击:投毒与后门

数据投毒:在训练数据中注入恶意样本;后门攻击(BadNets, Gu et al., 2017):模型平时表现正常,仅在输入含特定触发器时产生攻击者预期输出,仅需污染少量(常低于1%)训练样本即可成功;联邦学习后门(Bagdasaryan et al., 2020:How To Backdoor Federated Learning)。

③ 供应链攻击

模型仓库投毒(恶意pickle反序列化载荷);依赖链投毒(PyPI/npm,2026年LiteLLM事件:恶意.pth文件在任意Python进程启动时执行);AI工程工具链被攻陷(Trivy CI凭证被盗导致发布管道失守);社区需关注"slopsquatting"(AI代码助手幻觉出的包名被恶意抢注)等新型风险。

④ 运行时与权重层攻击

对抗样本(详见"对抗样本防御"子课题);权重隐写(EvilModel, USENIX Security 2021:将恶意软件嵌入DNN权重,模型文件即载荷);侧信道:经推理时延、内存访问模式推断模型结构或训练数据;权重篡改:直接修改参数改变决策逻辑。

重点威胁深度解析

1. 后门攻击:隐蔽且持久

后门攻击通过在训练阶段植入触发器,使模型对正常输入表现完全正常、仅在触发模式出现时输出攻击者指定结果。其隐蔽性在于:模型在干净测试集上的准确率可能不受影响,常规评估无法发现。检测与缓解的代表性学术工作包括Neural Cleanse(Wang et al., IEEE S&P 2019,通过逆向触发器检测后门)与ABS(Liu et al., CCS 2019,人工脑刺激扫描)。在开源模型生态中,攻击者上传含后门的模型供下游用户微调使用的风险尤为现实。

2. 成员推断攻击:隐私泄露风险

成员推断利用模型对训练集成员与非成员的置信度差异进行判断。在医疗、金融等敏感领域后果严重:若攻击者确认某患者病历在癌症诊断模型的训练集中,即间接获知该患者的病情。研究表明过拟合程度越高模型越脆弱;差分隐私训练(DP-SGD, Abadi et al., CCS 2016)可有效降低攻击成功率,但通常以模型精度为代价。学术评估工具如ML Privacy Meter(Murakonda & Shokri)可对成员推断脆弱性进行量化审计。

3. 模型窃取:知识产权与商业机密

对投入巨额资金训练的模型,API级窃取意味着知识产权的重大流失。防御手段包括:查询速率限制与异常查询检测、输出扰动/Top-k截断降低信息量、模型水印(Adi et al., NeurIPS 2018:向权重嵌入可在验证时提取的密钥化水印,用于泄露溯源)。

4. 大模型记忆化泄露

大语言模型会"记住"训练语料中的部分样本。Carlini et al.(USENIX Security 2021)证明可从GPT-2中提取出真实地址、电话、姓名等隐私文本;后续研究(Carlini et al., 2023, "Quantifying Memorization")系统量化了记忆化程度随模型规模增长而上升的趋势。防御方向包括差分隐私微调、输出过滤、Canary检测与查询审计。

防御体系与技术路线

训练阶段防御

  • 数据清洗与验证:建立训练数据质量评估流程,检测并移除异常样本与潜在投毒数据;
  • 差分隐私训练(DP-SGD):Abadi et al.(CCS 2016)提出的梯度裁剪+噪声注入机制,提供可证明的隐私保护(ε-DP);
  • 鲁棒训练与水印:对抗训练提升鲁棒性;嵌入模型水印支持泄露溯源(Adi et al., NeurIPS 2018)。

部署阶段防御

  • 权重完整性校验:模型哈希签名验证,防止部署阶段篡改;
  • 可信执行环境(TEE)与机密推理:硬件隔离环境中执行推理,保护模型参数与中间计算;
  • API访问控制:查询速率限制、输出扰动、异常查询模式检测(针对模型窃取与成员推断)。

供应链安全

  • 模型文件安全扫描:Picklescan、ModelScan(Protect AI开源)检测pickle/safetensors中的恶意代码;Fickling对pickle字节码做安全分析;
  • 依赖审计:锁定依赖版本、CI/CD最小权限与签名发布(LiteLLM事件的教训);
  • SBOM/AI-BOM:为AI系统建立覆盖数据、模型、依赖的完整物料清单,提升供应链透明度;
  • 私有镜像与来源验证:生产环境优先使用内部审计过的模型镜像,而非直接拉取社区权重。

评估基准与测试工具

评估维度代表性方法/工具关键指标
后门检测 Neural Cleanse(IEEE S&P 2019)、ABS(CCS 2019) 攻击成功率(ASR)、干净准确率(CA)、触发器逆向置信度
成员推断 阴影模型攻击(Shokri et al. 2017)、ML Privacy Meter 推断准确率、AUC-ROC、DP预算ε
模型窃取 替代模型训练(Tramèr et al. 2016)、Knockoff Nets(ICLR 2019) 替代模型准确率、所需查询次数
隐私提取 Carlini et al. 2021 提取方法、记忆化量化(2023) 可提取的真实样本数量、暴露率
供应链安全 Picklescan、ModelScan、Fickling、garak(LLM扫描) 恶意代码检出率、依赖漏洞覆盖率
对抗鲁棒性 ART(IBM)、Foolbox、CleverHans、TextAttack PGD/AutoAttack下鲁棒准确率

联邦学习与隐私计算安全

联邦学习允许多方在不共享原始数据的前提下联合训练,但其分布式特性引入新型攻击面:

  • 后门投毒:Bagdasaryan et al.(2020)证明单恶意参与方可在联邦平均中植入持久后门且难以检测;
  • 梯度泄露:梯度更新可能反推出参与方的训练样本(DLG攻击系列研究);
  • 防御方向:安全聚合、差分隐私参与、鲁棒聚合规则(如Krum、FoolsGold)、贡献度审计。

在国内合规语境下,联邦学习常与《个人信息保护法》《数据安全法》下的"数据不出域"需求结合落地,但"隐私计算≠绝对安全",仍需按本课题框架开展独立安全评估。

国内合规要求

  • 生成式AI备案:依据《生成式人工智能服务管理暂行办法》,面向公众提供服务的大模型须完成算法备案与安全评估(网信办已分批公告备案清单);
  • 训练数据合规:《个人信息保护法》《数据安全法》对训练数据来源合法性、最小必要与安全保障提出要求;《互联网信息服务算法推荐管理规定》(2022年3月1日施行)确立算法备案与透明度义务;
  • 深度合成治理:《互联网信息服务深度合成管理规定》(2023年1月10日施行)与《人工智能生成合成内容标识办法》(2025年9月1日施行)覆盖模型服务的输出侧合规。

参考来源(真实文献与官方资料)

[1]Shokri R. et al. Membership Inference Attacks Against Machine Learning Models. IEEE S&P 2017.
[2]Tramèr F. et al. Stealing Machine Learning Models via Prediction APIs. USENIX Security 2016.
[3]Fredrikson M. et al. Model Inversion Attacks that Exploit Confidence Information. CCS 2015.
[4]Gu T. et al. BadNets: Evaluating Backdooring Attacks on Deep Neural Networks. IEEE Access, 2019(2017年预印).
[5]Wang B. et al. Neural Cleanse: Identifying and Mitigating Backdoor Attacks in Neural Networks. IEEE S&P 2019.
[6]Liu Y. et al. ABS: Scanning Neural Networks for Back-doors by Artificial Brain Stimulation. CCS 2019.
[7]Abadi M. et al. Deep Learning with Differential Privacy. CCS 2016.
[8]Adi Y. et al. Turning Your Weakness Into a Strength: Watermarking Deep Neural Networks by Backdooring. USENIX Security 2018.
[9]Xu X. et al. EvilModel: Hiding Malware Inside of Neural Network Models. USENIX Security 2021.
[10]Carlini N. et al. Extracting Training Data from Large Language Models. USENIX Security 2021.
[11]Bagdasaryan E. et al. How To Backdoor Federated Learning. AISTATS 2020.
[12]MITRE ATLAS案例库(恶意模型/ML供应链案例). https://atlas.mitre.org/
← 返回AI驱动安全总览