本册回答防御者的核心问题:当攻击完成AI化转型,防守方如何"以AI对AI"?内容涵盖检测范式迁移、四层防御体系、大模型应用自身安全、对抗样本研究,以及国内外AI治理框架下的协同治理路径,并结合迪妙网络空间安全学院的培训实践给出落地建议。
AI生成内容天然规避签名检测:每封钓鱼邮件措辞不同、每个恶意样本哈希不同。防御的重心必须转向对"行为"而非"内容"的判别。
AI改变的是"内容",改变不了"意图"。无论钓鱼邮件措辞如何完美,其最终目标仍是诱导点击与凭证提交;无论勒索代码由谁生成,其运行时必然呈现"高频文件读写+批量重命名+加密扩展名写入+备份删除尝试"的行为指纹[3]。
多维关联是第二道护城河。现代检测体系关联文件访问模式、用户行为、时间序列与网络流量:非工作时间的批量数据访问、用户权限的突然提升、异常加密操作频率,都是AI难以"伪装干净"的宏观信号[3]。
学术侧的证据:Heiding等人的实验证明,GPT-4生成的钓鱼邮件虽能骗过普通用户,但结合上下文特征与风格分析的机器学习检测器仍可有效识别——"AI生成"本身会留下可检测的统计痕迹[1]。
数据来源:SE Labs《Data Corruption Detection (DCD): NetApp Autonomous Ransomware Protection with AI》独立测试报告(2024年6月,AAA评级、零误报);NetApp ONTAP官方技术文档[3]
针对AI赋能攻击链的分层防御架构:每一层都对应攻击链上的具体环节,层间以SOAR联动实现自动处置。
部署具备语义分析能力的邮件安全网关,不再依赖拼写错误等表面特征;对BEC类攻击启用"异常请求核验"流程——凡涉及转账、改账户、发数据的指令,无论发件人是谁,必须经第二独立信道(电话/当面)二次确认。此机制可直接瓦解深伪语音与AI钓鱼邮件的最终环节。
EDR/XDR覆盖全部终端,基于行为基线(UEBA)识别异常:批量文件加密进程、影子副本删除(vssadmin delete shadows)、可疑计划任务创建。对AI生成的新变种哈希,行为检测是唯一可靠的兜底手段。
严格执行3-2-1备份策略与不可变(WORM)备份,使"加密威胁"失去筹码;定期开展恢复演练,确保RTO/RPO目标可达成。FunkSec案例证明:免费解密器的发布可瞬间瓦解AI勒索组织的商业模式——防御方应持续跟踪No More Ransom与各厂商解密工具库。
企业引入AI助手/智能体时,须按OWASP LLM Top 10防控:提示词注入(LLM01)——攻击者可在检索内容、邮件、网页中埋入恶意指令劫持AI Agent(对应"四重勒索"中的自动化攻击链);同时防范训练数据投毒、敏感信息泄露与越权代理。企业AI应用的输入输出须建立审计与人工确认闸门。
MITRE ATLAS(Adversarial Threat Landscape for Artificial-Intelligence Systems)是专门针对AI系统的对抗战术知识库,覆盖机器学习模型的探测、规避、投毒与提取等TTP。防御AI驱动勒索,需要把ATLAS与ATT&CK映射使用:前者保模型,后者保业务。
技术手段之外,"人"仍是最后防线。迪妙网络空间安全学院面向企业员工的反钓演练体系已纳入AI生成内容识别模块:语法完美的邮件不等于合法邮件、"听到老板声音"不等于"老板本人"——通过高频次模拟演练,将"二次核验"内化为组织肌肉记忆。
攻防对抗正在升级为"AI对AI"的直接交锋:攻击者会主动探测并利用防御方机器学习模型的弱点。
方向一:规避攻击(Evasion)。攻击者通过微调恶意代码的统计特征,诱使ML检测器误判。Google Cloud GTIG已观测到"执行中动态改变行为"的AI驱动恶意软件——载荷哈希持续变化,使基于静态特征的检测体系系统性失效[2]。防御要点:优先采用行为级与流量级特征,缩短模型更新周期。
方向二:投毒与后门(Poisoning)。如果防御模型依赖众包样本或第三方情报 feed,攻击者可能注入精心构造的"毒化样本"腐蚀训练数据。防御要点:数据来源分级校验、训练集完整性审计、模型漂移监控。
方向三:提示词注入与智能体劫持(Prompt Injection)。OWASP LLM Top 10将提示词注入列为LLM应用首要风险(LLM01)[4]。当企业安全运营引入AI Agent(自动研判、自动隔离),攻击者可借恶意邮件内容向Agent注入指令——这把传统钓鱼升级为"对AI员工的钓鱼"。防御要点:输入 sanitization、最小权限Agent、关键操作人工确认(Human-in-the-loop)。
AI驱动勒索的治理需要技术、法律与国际协作的组合拳。
| 框架/规则 | 发布方/时间 | 与反勒索相关的核心内容 |
|---|---|---|
| EU AI Act Regulation (EU) 2024/1689 | 欧盟,2024年8月生效 | 全球首部综合性AI立法,采用风险分级监管;对AI系统供应链安全、透明度义务与高风险应用合规提出强制要求,为打击AI滥用提供法律依据[5] |
| NIST AI风险管理框架(AI RMF 1.0) | 美国NIST,2023年1月 | 提出"Govern—Map—Measure—Manage"四步风险管理循环,是企业构建AI安全治理体系的重要参照[5] |
| 《生成式人工智能服务管理暂行办法》 | 中国七部门,2023年8月施行 | 明确生成式AI服务提供者的安全义务与违法内容处置责任,从源头压实模型方责任 |
| 《人工智能生成合成内容标识办法》 | 中国国家网信办等四部门,2025年9月1日施行 | 要求AI生成合成内容添加显式与隐式标识——为深伪内容溯源与公众识别提供制度基础,直接针对深伪社工类攻击 |
| 日本AI制毒入刑判例 | 东京地方法院,2024年10月 | 日本首例因滥用生成式AI开发勒索病毒被定罪:25岁无IT技能男子被判处有期徒刑三年、缓刑四年;被告称"没有生成AI的帮助,根本无法制作出这种病毒"[8] |
| No More Ransom 项目 | 欧洲刑警组织等,2016年发起 | 提供100+免费解密工具的国际协作机制——FunkSec解密器即通过此生态发布,是"技术反制"的标杆实践[7] |
建议一:把"AI内容识别"纳入常态化钓鱼演练。传统演练邮件刻意保留语法错误,已无法模拟真实威胁。建议演练素材改用AI生成的"完美钓鱼邮件"与深伪语音样本,训练员工基于"请求内容风险"而非"文本质量"做判断——这正是本院攻防演练体系的核心升级方向。
建议二:建立"转账与敏感操作双人核验"的硬制度。香港2亿港元深伪案、多起BEC案件的共同点,都是"单一员工+单一信道"完成关键操作。制度层面的二次核验成本极低,却能瓦解绝大多数AI社工攻击。
建议三:企业引入AI Agent时同步开展LLM安全评估。参照OWASP LLM Top 10与MITRE ATLAS,对AI应用开展上线前评估与运行期审计,避免"为了效率引入的新工具"成为攻击者的新入口。
以下文献均为公开可查证的原始报告、学术论文、法规文本或权威机构资料。
全专题引用原则:仅采用安全厂商原始报告、学术论文(arXiv/顶会)、政府与国际组织发布物及权威媒体一手报道;厂商实测数据均已标注厂商来源,读者可按需独立复核。