研究模型窃取、成员推断、模型逆向等隐私攻击,以及数据投毒、后门植入、权重篡改等完整性威胁,构建模型全生命周期安全评估体系。
机器学习模型正成为企业核心数字资产。从金融风控到医疗诊断,从自动驾驶到内容审核,模型的决策直接影响业务安全与用户权益。然而,模型的"黑箱"特性与"数据驱动"本质使其面临独特的安全威胁:攻击者无需访问训练数据即可窃取模型功能、推断训练集成员,通过精心构造的输入即可操控模型输出,在训练阶段植入的后门可在部署后静默激活。
模型供应链安全形势尤为严峻。Hugging Face平台托管模型数量于2025年突破100万个,安全审核主要依赖平台扫描与社区举报;EvilModel研究(USENIX Security 2021)早已证明恶意载荷可隐写进模型权重本身,MITRE ATLAS亦收录了真实案例(攻击者上传含反向shell代码的pickle格式恶意模型)。2026年3月的LiteLLM事件(TeamPCP经被攻陷的CI凭证向PyPI投毒)再次警示:AI工程链路中的任何一环都可能成为攻击入口。
核心洞察:模型安全不仅是技术问题,更是供应链治理问题——从训练数据、模型权重、微调数据集到部署模板,每个环节都可能成为攻击入口;且大模型的"记忆化"特性使训练数据泄露成为新型隐私风险(Carlini et al., USENIX Security 2021)。
模型窃取(Tramèr et al., USENIX Security 2016:经预测API抽取等价模型);成员推断(Shokri et al., IEEE S&P 2017:判断数据是否在训练集中);模型逆向(Fredrikson et al., CCS 2015:从置信度输出重建训练样本特征);大模型数据提取(Carlini et al., USENIX Security 2021:从GPT-2提取出真实个人隐私文本)。
数据投毒:在训练数据中注入恶意样本;后门攻击(BadNets, Gu et al., 2017):模型平时表现正常,仅在输入含特定触发器时产生攻击者预期输出,仅需污染少量(常低于1%)训练样本即可成功;联邦学习后门(Bagdasaryan et al., 2020:How To Backdoor Federated Learning)。
模型仓库投毒(恶意pickle反序列化载荷);依赖链投毒(PyPI/npm,2026年LiteLLM事件:恶意.pth文件在任意Python进程启动时执行);AI工程工具链被攻陷(Trivy CI凭证被盗导致发布管道失守);社区需关注"slopsquatting"(AI代码助手幻觉出的包名被恶意抢注)等新型风险。
对抗样本(详见"对抗样本防御"子课题);权重隐写(EvilModel, USENIX Security 2021:将恶意软件嵌入DNN权重,模型文件即载荷);侧信道:经推理时延、内存访问模式推断模型结构或训练数据;权重篡改:直接修改参数改变决策逻辑。
1. 后门攻击:隐蔽且持久
后门攻击通过在训练阶段植入触发器,使模型对正常输入表现完全正常、仅在触发模式出现时输出攻击者指定结果。其隐蔽性在于:模型在干净测试集上的准确率可能不受影响,常规评估无法发现。检测与缓解的代表性学术工作包括Neural Cleanse(Wang et al., IEEE S&P 2019,通过逆向触发器检测后门)与ABS(Liu et al., CCS 2019,人工脑刺激扫描)。在开源模型生态中,攻击者上传含后门的模型供下游用户微调使用的风险尤为现实。
2. 成员推断攻击:隐私泄露风险
成员推断利用模型对训练集成员与非成员的置信度差异进行判断。在医疗、金融等敏感领域后果严重:若攻击者确认某患者病历在癌症诊断模型的训练集中,即间接获知该患者的病情。研究表明过拟合程度越高模型越脆弱;差分隐私训练(DP-SGD, Abadi et al., CCS 2016)可有效降低攻击成功率,但通常以模型精度为代价。学术评估工具如ML Privacy Meter(Murakonda & Shokri)可对成员推断脆弱性进行量化审计。
3. 模型窃取:知识产权与商业机密
对投入巨额资金训练的模型,API级窃取意味着知识产权的重大流失。防御手段包括:查询速率限制与异常查询检测、输出扰动/Top-k截断降低信息量、模型水印(Adi et al., NeurIPS 2018:向权重嵌入可在验证时提取的密钥化水印,用于泄露溯源)。
4. 大模型记忆化泄露
大语言模型会"记住"训练语料中的部分样本。Carlini et al.(USENIX Security 2021)证明可从GPT-2中提取出真实地址、电话、姓名等隐私文本;后续研究(Carlini et al., 2023, "Quantifying Memorization")系统量化了记忆化程度随模型规模增长而上升的趋势。防御方向包括差分隐私微调、输出过滤、Canary检测与查询审计。
训练阶段防御
部署阶段防御
供应链安全
| 评估维度 | 代表性方法/工具 | 关键指标 |
|---|---|---|
| 后门检测 | Neural Cleanse(IEEE S&P 2019)、ABS(CCS 2019) | 攻击成功率(ASR)、干净准确率(CA)、触发器逆向置信度 |
| 成员推断 | 阴影模型攻击(Shokri et al. 2017)、ML Privacy Meter | 推断准确率、AUC-ROC、DP预算ε |
| 模型窃取 | 替代模型训练(Tramèr et al. 2016)、Knockoff Nets(ICLR 2019) | 替代模型准确率、所需查询次数 |
| 隐私提取 | Carlini et al. 2021 提取方法、记忆化量化(2023) | 可提取的真实样本数量、暴露率 |
| 供应链安全 | Picklescan、ModelScan、Fickling、garak(LLM扫描) | 恶意代码检出率、依赖漏洞覆盖率 |
| 对抗鲁棒性 | ART(IBM)、Foolbox、CleverHans、TextAttack | PGD/AutoAttack下鲁棒准确率 |
联邦学习允许多方在不共享原始数据的前提下联合训练,但其分布式特性引入新型攻击面:
在国内合规语境下,联邦学习常与《个人信息保护法》《数据安全法》下的"数据不出域"需求结合落地,但"隐私计算≠绝对安全",仍需按本课题框架开展独立安全评估。