勒索软件研究 · 子课题 08 / 08 · 专题研究分册

AI驱动防御与治理

本册回答防御者的核心问题:当攻击完成AI化转型,防守方如何"以AI对AI"?内容涵盖检测范式迁移、四层防御体系、大模型应用自身安全、对抗样本研究,以及国内外AI治理框架下的协同治理路径,并结合迪妙网络空间安全学院的培训实践给出落地建议。

研究框架 V1.0 分册 第 3 页 / 共 3 页 引用来源 10+ 权威机构 更新 2026年9月
01

范式迁移:从"特征匹配"到"行为异常检测"

AI生成内容天然规避签名检测:每封钓鱼邮件措辞不同、每个恶意样本哈希不同。防御的重心必须转向对"行为"而非"内容"的判别。

0%
存储层AI勒索检测率(SE Labs验证)
NetApp ARP/AI经独立机构SE Labs测试获AAA最高评级:勒索攻击检出率99%、零误报;预训练模型无需学习期即开即用[3]
0
独立测试中的误报数量
SE Labs对ARP/AI的独立测试:100%正常文件被正确识别,零误报——避免告警疲劳是AI检测落地的关键前提[3]
0day
零日变种检测能力
预训练行为模型无需学习期即可生效,对AI生成的未知威胁变种具备"零日"识别力[3]
0万份
年度解密文件规模
360反勒索服务2025年协助2271位用户解密486万份文件、挽回损失逾4700万元(来源:360《2025勒索软件流行态势报告》,2026年1月发布)——检测之外的"恢复兜底"同样关键

为什么行为检测能克制AI生成威胁

AI改变的是"内容",改变不了"意图"。无论钓鱼邮件措辞如何完美,其最终目标仍是诱导点击与凭证提交;无论勒索代码由谁生成,其运行时必然呈现"高频文件读写+批量重命名+加密扩展名写入+备份删除尝试"的行为指纹[3]。

多维关联是第二道护城河。现代检测体系关联文件访问模式、用户行为、时间序列与网络流量:非工作时间的批量数据访问、用户权限的突然提升、异常加密操作频率,都是AI难以"伪装干净"的宏观信号[3]。

学术侧的证据:Heiding等人的实验证明,GPT-4生成的钓鱼邮件虽能骗过普通用户,但结合上下文特征与风格分析的机器学习检测器仍可有效识别——"AI生成"本身会留下可检测的统计痕迹[1]。

未知变种检出能力:传统签名检测 vs AI行为检测(%)

面对从未见过的新变种(零日场景),基于预训练行为模型的检测与基于签名的检测差距显著
传统签名检测对全新哈希变种检出≈0%ARP/AI对数百个已知及新型变种的检出率99%

数据来源:SE Labs《Data Corruption Detection (DCD): NetApp Autonomous Ransomware Protection with AI》独立测试报告(2024年6月,AAA评级、零误报);NetApp ONTAP官方技术文档[3]

02

四层防御体系构建

针对AI赋能攻击链的分层防御架构:每一层都对应攻击链上的具体环节,层间以SOAR联动实现自动处置。

第一层:邮件与内容安全 拦截AI钓鱼

部署具备语义分析能力的邮件安全网关,不再依赖拼写错误等表面特征;对BEC类攻击启用"异常请求核验"流程——凡涉及转账、改账户、发数据的指令,无论发件人是谁,必须经第二独立信道(电话/当面)二次确认。此机制可直接瓦解深伪语音与AI钓鱼邮件的最终环节。

第二层:端点与行为检测 EDR/XDR

EDR/XDR覆盖全部终端,基于行为基线(UEBA)识别异常:批量文件加密进程、影子副本删除(vssadmin delete shadows)、可疑计划任务创建。对AI生成的新变种哈希,行为检测是唯一可靠的兜底手段。

第三层:数据与备份韧性 不可变备份

严格执行3-2-1备份策略与不可变(WORM)备份,使"加密威胁"失去筹码;定期开展恢复演练,确保RTO/RPO目标可达成。FunkSec案例证明:免费解密器的发布可瞬间瓦解AI勒索组织的商业模式——防御方应持续跟踪No More Ransom与各厂商解密工具库。

第四层:大模型应用安全 LLM Security

企业引入AI助手/智能体时,须按OWASP LLM Top 10防控:提示词注入(LLM01)——攻击者可在检索内容、邮件、网页中埋入恶意指令劫持AI Agent(对应"四重勒索"中的自动化攻击链);同时防范训练数据投毒、敏感信息泄露与越权代理。企业AI应用的输入输出须建立审计与人工确认闸门。

对抗参照系:MITRE ATLAS AI攻防知识库

MITRE ATLAS(Adversarial Threat Landscape for Artificial-Intelligence Systems)是专门针对AI系统的对抗战术知识库,覆盖机器学习模型的探测、规避、投毒与提取等TTP。防御AI驱动勒索,需要把ATLAS与ATT&CK映射使用:前者保模型,后者保业务。

人员层:深伪识别与意识训练 迪妙实践

技术手段之外,"人"仍是最后防线。迪妙网络空间安全学院面向企业员工的反钓演练体系已纳入AI生成内容识别模块:语法完美的邮件不等于合法邮件、"听到老板声音"不等于"老板本人"——通过高频次模拟演练,将"二次核验"内化为组织肌肉记忆。

术语说明——勒索模式演进:单重勒索(仅加密文件索赎金)→双重勒索(加密+窃取数据并以公开泄露施压,2025年Solar团队处置的534起案件中占55.32%)→三重勒索(叠加DDoS攻击,或直接联系受害者客户、合作伙伴与媒体施压)→四重勒索(进一步将攻击自动化、AI化,并向供应链上下游扩散连带影响)。AI技术在演进的后半程充当"自动化与规模化引擎":批量生成变种、自动筛选高价值目标、AI客服化谈判,使同一运营团队能够同时操盘的受害者数量成倍增长。
03

对抗样本研究:当攻击者开始攻击"防守方的AI"

攻防对抗正在升级为"AI对AI"的直接交锋:攻击者会主动探测并利用防御方机器学习模型的弱点。

三个必须正视的对抗方向

方向一:规避攻击(Evasion)。攻击者通过微调恶意代码的统计特征,诱使ML检测器误判。Google Cloud GTIG已观测到"执行中动态改变行为"的AI驱动恶意软件——载荷哈希持续变化,使基于静态特征的检测体系系统性失效[2]。防御要点:优先采用行为级与流量级特征,缩短模型更新周期。

方向二:投毒与后门(Poisoning)。如果防御模型依赖众包样本或第三方情报 feed,攻击者可能注入精心构造的"毒化样本"腐蚀训练数据。防御要点:数据来源分级校验、训练集完整性审计、模型漂移监控。

方向三:提示词注入与智能体劫持(Prompt Injection)。OWASP LLM Top 10将提示词注入列为LLM应用首要风险(LLM01)[4]。当企业安全运营引入AI Agent(自动研判、自动隔离),攻击者可借恶意邮件内容向Agent注入指令——这把传统钓鱼升级为"对AI员工的钓鱼"。防御要点:输入 sanitization、最小权限Agent、关键操作人工确认(Human-in-the-loop)。

"恶意LLM生态对上游合法模型供应链高度依赖——OpenAI弃用旧模型后,WolfGPT、Evil-GPT、DarkGPT应声停摆。上游护栏与模型生命周期管理,是对地下AI生态最有力的'断供打击'。" —— 本专题基于arXiv:2401.03315(Malla研究)的核心治理结论[6]
04

治理框架:国内外规则体系与协同路径

AI驱动勒索的治理需要技术、法律与国际协作的组合拳。

框架/规则发布方/时间与反勒索相关的核心内容
EU AI Act
Regulation (EU) 2024/1689
欧盟,2024年8月生效全球首部综合性AI立法,采用风险分级监管;对AI系统供应链安全、透明度义务与高风险应用合规提出强制要求,为打击AI滥用提供法律依据[5]
NIST AI风险管理框架(AI RMF 1.0)美国NIST,2023年1月提出"Govern—Map—Measure—Manage"四步风险管理循环,是企业构建AI安全治理体系的重要参照[5]
《生成式人工智能服务管理暂行办法》中国七部门,2023年8月施行明确生成式AI服务提供者的安全义务与违法内容处置责任,从源头压实模型方责任
《人工智能生成合成内容标识办法》中国国家网信办等四部门,2025年9月1日施行要求AI生成合成内容添加显式与隐式标识——为深伪内容溯源与公众识别提供制度基础,直接针对深伪社工类攻击
日本AI制毒入刑判例东京地方法院,2024年10月日本首例因滥用生成式AI开发勒索病毒被定罪:25岁无IT技能男子被判处有期徒刑三年、缓刑四年;被告称"没有生成AI的帮助,根本无法制作出这种病毒"[8]
No More Ransom 项目欧洲刑警组织等,2016年发起提供100+免费解密工具的国际协作机制——FunkSec解密器即通过此生态发布,是"技术反制"的标杆实践[7]

迪妙网络空间安全学院的三点落地建议

建议一:把"AI内容识别"纳入常态化钓鱼演练。传统演练邮件刻意保留语法错误,已无法模拟真实威胁。建议演练素材改用AI生成的"完美钓鱼邮件"与深伪语音样本,训练员工基于"请求内容风险"而非"文本质量"做判断——这正是本院攻防演练体系的核心升级方向。

建议二:建立"转账与敏感操作双人核验"的硬制度。香港2亿港元深伪案、多起BEC案件的共同点,都是"单一员工+单一信道"完成关键操作。制度层面的二次核验成本极低,却能瓦解绝大多数AI社工攻击。

建议三:企业引入AI Agent时同步开展LLM安全评估。参照OWASP LLM Top 10与MITRE ATLAS,对AI应用开展上线前评估与运行期审计,避免"为了效率引入的新工具"成为攻击者的新入口。

05

本分册参考文献

以下文献均为公开可查证的原始报告、学术论文、法规文本或权威机构资料。

  1. Heiding F., Schneier B., Vishwanath A. Devising and Detecting Phishing Emails Using Large Language Models. arXiv:2306.00048, 2023. arxiv.org/abs/2306.00048
  2. Google Cloud / Google Threat Intelligence Group (GTIG). 威胁行为者AI滥用相关研究(2025年,经MSSP Alert《Attackers Relying More on AI, Inexpensive Components in Campaigns》转引:AI驱动恶意软件呈现"执行中动态改变行为"特征). msspalert.com
  3. NetApp官方技术文档 / SE Labs. Autonomous Ransomware Protection/AI(ARP/AI):预训练AI模型基于超百万文件与真实勒索攻击数据训练,无需学习期即开即用,官方口径"优于99%的检测准确率";SE Labs独立测试(2024年6月DCD报告)授予AAA最高评级,勒索攻击检出率99%、零误报. docs.netapp.com
  4. OWASP. OWASP Top 10 for Large Language Model Applications(LLM01: Prompt Injection). genai.owasp.org/llm-top-10/
  5. European Union / NIST. Regulation (EU) 2024/1689(EU AI Act)NIST AI Risk Management Framework 1.0(AI RMF), 2023. nist.gov/itl/ai-risk-management-framework
  6. Lin Z., Cui J., Liao X., Wang X. Malla: Demystifying Real-world Large Language Model Integrated Malicious Services. USENIX Security 2024录用;arXiv:2401.03315, 2024. arxiv.org/abs/2401.03315
  7. No More Ransom 项目(欧洲刑警组织、荷兰国家警察、卡巴斯基、McAfee等联合发起). nomoreransom.org
  8. 读卖新闻 / IT之家 / 新浪科技. 《因使用生成式AI制作恶意软件,日本一25岁男子首次被判有罪》(东京地方法院,2024年10月;判处有期徒刑三年、缓刑四年). finance.sina.com.cn
  9. 360数字安全集团. 《2025勒索软件流行态势报告》(2025年处理2179起勒索求助;协助2271位用户解密486万份文件、挽回损失逾4700万元;识别84个新家族其中多重勒索家族约半数). 2026年1月. 360.cn
  10. MITRE. ATLAS: Adversarial Threat Landscape for Artificial-Intelligence Systems. atlas.mitre.org
  11. 国家互联网信息办公室等七部门. 《生成式人工智能服务管理暂行办法》(2023年8月15日施行);国家网信办等四部门. 《人工智能生成合成内容标识办法》(2025年9月1日施行).

全专题引用原则:仅采用安全厂商原始报告、学术论文(arXiv/顶会)、政府与国际组织发布物及权威媒体一手报道;厂商实测数据均已标注厂商来源,读者可按需独立复核。

上一分册:恶意AI生态与典型案例
AI驱动勒索软件研究 · 第 3 页 / 共 3 页
下一页(无)