人工智能技术正在重塑网络安全攻防格局。攻击者利用大模型生成高度逼真的钓鱼内容、实现语音视频深度伪造、自动化漏洞挖掘与利用链构建;防御者则借助AI实现异常检测、威胁狩猎与智能响应。本专题系统研究AI在网络安全领域的双刃剑效应,构建面向未来的智能防御体系。
AI既是攻击者的"力量倍增器",也是防御者的"智能助手"。本专题从攻防双重视角,系统研究AI技术在网络安全领域的应用与挑战。
攻击者利用大语言模型生成语法正确、语境自然的钓鱼邮件(KnowBe4 2025年报告:82.6%的钓鱼邮件含AI生成内容),深度伪造技术实现语音/视频身份冒充,AI Agent被用于自动化渗透与漏洞利用,大幅降低攻击门槛。
基于AI的异常检测与行为分析已成为SOC标配能力——约三分之二组织已在安全运营中部署安全AI与自动化;深度部署者单次泄露成本平均降低188万美元、识别与遏制周期缩短约98天(IBM 2024)。
OWASP LLM Top 10(2026年8月版首次引入7,714起真实事件数据)、OWASP Agentic Top 10(2025年12月)、MITRE ATLAS(v5.1.0,2025年11月)、NIST AI RMF及生成式AI配置文件等国际权威框架在2025—2026年密集更新,AI安全治理体系加速成型。
每个子课题均可独立拓展为深度专题,形成"总览—专题—子课题"的三级研究架构,点击卡片进入详细内容。
系统研究大语言模型(LLM)应用层安全风险,覆盖提示词注入、敏感信息泄露、供应链漏洞、过度代理等OWASP LLM Top 10核心风险,以及AI Agent的权限滥用与目标劫持。
研究基于机器学习和深度学习的异常检测、行为分析、威胁狩猎技术,探索AI在端点安全、网络流量分析、日志审计等场景中的检测效能与误报优化。
研究AIGC技术对钓鱼攻击的赋能效应,包括AI生成钓鱼邮件的检测对抗、深度伪造在社会工程中的应用,以及基于AI的钓鱼内容识别与防御策略框架。
研究模型窃取、成员推断、模型逆向等隐私攻击,以及数据投毒、后门植入、权重篡改等完整性威胁,构建模型全生命周期安全评估体系。
研究LLM Agent驱动的自动化代码审计、智能Fuzzing种子生成、符号执行增强、静态分析误报压缩等技术,探索AI在0-day漏洞发现中的能力边界(DARPA AIxCC 2025已验证其可行性)。
研究对抗样本的生成机理与检测方法,探索对抗训练、输入净化、认证防御、扩散模型去噪等防御技术,覆盖图像、文本、音频、多模态等全场景。
以下数据均来自可公开核实的权威来源(政府机构、国际组织、上市公司年度报告、顶会论文),逐条标注出处。
| 威胁类型 | 攻击手段 | 影响范围 | 趋势 | 风险等级 |
|---|---|---|---|---|
| 提示词注入 | 直接/间接注入,绕过安全护栏(EchoLeak等零点击漏洞) | LLM应用、RAG系统、AI Agent、MCP工具链 | ↑ 持续高发(OWASP 2026仍列第1位) | 严重 |
| 深度伪造欺诈 | AI生成语音/视频,身份冒用与社交工程(3秒音频即可克隆声音) | 金融、政务、企业BEC;香港Arup单案损失2亿港元 | ↑ 快速增长(美国2025年深伪欺诈损失约11亿美元) | 严重 |
| AI生成钓鱼 | LLM生成高逼真钓鱼邮件,多语言/多场景/多态变形 | 企业邮箱、SaaS平台;82.6%钓鱼邮件含AI内容 | ↑ 已成为主流生产方式 | 高危 |
| Agent供应链攻击 | MCP/Skill文件投毒,恶意工具调用(ClawHub约12%为恶意skills) | 编码Agent、自动化工作流、AI工具链(LiteLLM/Trivy事件) | ↑ 2026年集中爆发 | 高危 |
| 过度代理 | Agent权限滥用、误删生产数据、被诱导执行恶意操作(GTG-1002事件) | 企业AI Agent、自动化系统;OWASP 2026升至LLM03 | ↑ 排名跃升最快的风险 | 高危 |
| 模型后门 | 训练数据投毒、权重篡改、神经元编辑 | 开源模型、HuggingFace生态(已托管超100万个模型) | ↑ 隐蔽持久 | 高危 |
| 数据与记忆投毒 | RAG知识库污染、Agent记忆注入、偏好数据篡改 | 检索增强生成、微调模型、多Agent系统 | ↑ 攻击面扩大 | 高危 |
| 对抗样本 | 像素级扰动、多模态对抗、物理世界攻击 | 图像识别、自动驾驶、语音验证、内容审核 | → 技术持续深化 | 中危 |
跟踪国际权威AI安全框架的最新演进(以下版本与发布时间均经核实),为研究与实践提供标准化指引。
首次引入真实事件数据(7,714起事件,6,639起可分类):提示词注入、敏感信息泄露保持前两位;过度代理(Excessive Agency)由第6位跃升至第3位;System Prompt Leakage更名并扩展为Hidden Context Exposure(隐藏上下文暴露);无界消耗升至第6位。2026版还将风险映射到NIST、MITRE ATLAS、CWE及Agentic Top 10。
在Black Hat Europe 2025上由OWASP Agentic Security Initiative发布,经100余名行业专家评审:ASI01 Agent目标劫持、ASI02 工具误用与利用、ASI03 身份与权限滥用、ASI04 Agent供应链漏洞、ASI05 意外代码执行、ASI06 记忆与上下文投毒、ASI07 Agent间不安全通信、ASI08 级联故障、ASI09 人机信任利用、ASI10 流氓Agent。
v5.1.0(2025年11月)包含16个战术、84个技术、56个子技术、32项缓解措施与42个真实案例;新增第16个战术"Command and Control"及一批Agent导向技术(LLM Prompt Injection AML.T0051含直接/间接注入子技术、LLM Jailbreak AML.T0054、RAG投毒、工具投毒等);v2026.06(2026年6月)持续扩充智能体攻击技术集。
《AI风险管理框架(AI RMF 1.0)》于2023年1月发布;配套《生成式AI配置文件(NIST-AI-600-1)》于2024年7月发布,为生成式AI提供差异化风险治理建议;《网络安全框架CSF 2.0》(2024年2月)亦将AI风险纳入组织整体网络风险管理。
我国已初步形成覆盖生成式AI服务、深度合成内容、算法推荐的治理框架,以下法规的发布与施行时间均经核实。
我国首部生成式AI专门规章,确立"包容审慎、分类分级"监管原则,要求提供具有舆论属性或社会动员能力的生成式AI服务须履行安全评估与算法备案手续;训练数据不得侵害知识产权,需提升数据质量与真实性。
针对深度合成(含AI换脸、拟声)服务,要求落实信息安全主体责任,对生物识别信息编辑、人脸替换等可能造成公众混淆误认的功能进行显著标识;2025年网信办开展"清朗·整治AI技术滥用"专项行动,重点治理利用AI换脸拟声实施诈骗等问题。
配套强制性国家标准(GB 45438-2025),明确要求对AI生成合成文本、图片、音频、视频等内容添加显式标识(文字/语音提示)与隐式标识(元数据),任何组织和个人不得恶意删除、篡改、伪造、隐匿标识,从内容源头遏制深伪滥用。
提出"以人为本、智能向善"核心理念和包容审慎、确保安全等原则,将AI安全风险分为模型算法安全、数据安全、系统安全、内容安全、认知安全、伦理安全等维度,是我国AI安全治理的基础性文件;TC260同步发布《生成式人工智能服务安全基本要求》(TC260-003)。
以下成果均来自可核实的公开发表渠道(顶会论文、arXiv、厂商官方披露),点击标题可在公开渠道检索原文。
Google Security Blog / Project Zero, 2024–2025
IEEE/ACM 46th International Conference on Software Engineering, 2024
arXiv, 2025(AIxCC决赛相关论文)
Network and Distributed System Security Symposium, 2025
arXiv, 2025
30th USENIX Security Symposium, 2021
从基础能力构建到Agent化智能防御,分阶段推进AI安全研究体系建设(规划性内容,持续滚动修订)。
完成AI安全威胁分类体系构建,持续跟踪OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF等框架演进。建立大模型安全攻防实验环境,完成提示词注入、越狱攻击等基础攻击面的系统性验证。
聚焦AI Agent安全(OWASP Agentic Top 10 2026)、LLM Agent自动化漏洞挖掘(DARPA AIxCC成果跟踪)、智能Fuzzing、供应链安全(LiteLLM/OpenClaw等真实事件复盘)等前沿方向。建设AI钓鱼生成与检测对抗实验平台,输出系列技术白皮书。
扩展至多模态大模型安全(视觉-语言-动作模型)、具身智能安全、可信AI评估体系。结合《人工智能生成合成内容标识办法》实施进展,研究生成内容检测与溯源技术,构建AI安全评测基准与红队测试方法论。
构建AI驱动的自主安全运营能力,实现从威胁感知到自动响应的闭环;跟踪AIxCC开源网络推理系统(CRS)在真实开源社区的落地进展,探索跨机构AI威胁情报共享机制。
本专题全部统计数据遵循以下引用原则,欢迎读者逐条核实:
免责声明:本专题仅用于安全教育与研究交流。文中涉及的攻击技术描述均以防御为目的作科普性说明,不提供可操作的攻击指引;模拟演练请在授权环境下进行。