前沿研究 · 攻防一体 · 智能防御

AI驱动安全研究

人工智能技术正在重塑网络安全攻防格局。攻击者利用大模型生成高度逼真的钓鱼内容、实现语音视频深度伪造、自动化漏洞挖掘与利用链构建;防御者则借助AI实现异常检测、威胁狩猎与智能响应。本专题系统研究AI在网络安全领域的双刃剑效应,构建面向未来的智能防御体系。

0
钓鱼邮件含AI生成内容(KnowBe4,2025)
0
美元:2026年全球AI安全市场规模(MarketsandMarkets)
0
美元:2013–2023年全球BEC累计暴露损失(FBI)
0
元:2023年国内AI换脸视频诈骗单案损失

当前威胁态势 TOP 6

提示词注入攻击(Prompt Injection)严重
AI生成深度伪造(Deepfake)严重
超个性化AI钓鱼邮件高危
AI Agent供应链投毒(ClawHub事件)高危
Agent过度代理与权限滥用高危
模型后门与权重篡改中危

AI安全的双重维度

AI既是攻击者的"力量倍增器",也是防御者的"智能助手"。本专题从攻防双重视角,系统研究AI技术在网络安全领域的应用与挑战。

攻击侧:AI赋能威胁

攻击者利用大语言模型生成语法正确、语境自然的钓鱼邮件(KnowBe4 2025年报告:82.6%的钓鱼邮件含AI生成内容),深度伪造技术实现语音/视频身份冒充,AI Agent被用于自动化渗透与漏洞利用,大幅降低攻击门槛。

82.6% 的钓鱼邮件已含AI生成内容(KnowBe4 2025)

防御侧:AI增强检测

基于AI的异常检测与行为分析已成为SOC标配能力——约三分之二组织已在安全运营中部署安全AI与自动化;深度部署者单次泄露成本平均降低188万美元、识别与遏制周期缩短约98天(IBM 2024)。

$188万 深度部署安全AI/自动化平均节省的泄露成本(IBM 2024)

治理侧:标准与框架

OWASP LLM Top 10(2026年8月版首次引入7,714起真实事件数据)、OWASP Agentic Top 10(2025年12月)、MITRE ATLAS(v5.1.0,2025年11月)、NIST AI RMF及生成式AI配置文件等国际权威框架在2025—2026年密集更新,AI安全治理体系加速成型。

4+ 大国际权威框架于2025—2026年密集更新

六大核心研究方向

每个子课题均可独立拓展为深度专题,形成"总览—专题—子课题"的三级研究架构,点击卡片进入详细内容。

核心课题 研究中

大模型安全攻防

系统研究大语言模型(LLM)应用层安全风险,覆盖提示词注入、敏感信息泄露、供应链漏洞、过度代理等OWASP LLM Top 10核心风险,以及AI Agent的权限滥用与目标劫持。

提示词注入越狱攻击Agent安全供应链RAG安全
核心课题 研究中

AI辅助威胁检测

研究基于机器学习和深度学习的异常检测、行为分析、威胁狩猎技术,探索AI在端点安全、网络流量分析、日志审计等场景中的检测效能与误报优化。

异常检测UEBA威胁狩猎行为分析SIEM增强
核心课题 研究中

智能钓鱼生成与识别

研究AIGC技术对钓鱼攻击的赋能效应,包括AI生成钓鱼邮件的检测对抗、深度伪造在社会工程中的应用,以及基于AI的钓鱼内容识别与防御策略框架。

AI钓鱼检测深度伪造社会工程内容溯源BEC防御
核心课题 深度研究

机器学习模型安全

研究模型窃取、成员推断、模型逆向等隐私攻击,以及数据投毒、后门植入、权重篡改等完整性威胁,构建模型全生命周期安全评估体系。

模型窃取成员推断数据投毒后门攻击权重安全
核心课题 研究中

自动化漏洞挖掘

研究LLM Agent驱动的自动化代码审计、智能Fuzzing种子生成、符号执行增强、静态分析误报压缩等技术,探索AI在0-day漏洞发现中的能力边界(DARPA AIxCC 2025已验证其可行性)。

Agent审计智能Fuzzing符号执行SAST增强0-day发现
核心课题 深度研究

对抗样本防御

研究对抗样本的生成机理与检测方法,探索对抗训练、输入净化、认证防御、扩散模型去噪等防御技术,覆盖图像、文本、音频、多模态等全场景。

对抗训练输入净化认证防御多模态对抗扩散去噪

AI安全关键数据

以下数据均来自可公开核实的权威来源(政府机构、国际组织、上市公司年度报告、顶会论文),逐条标注出处。

82.6%
分析样本中钓鱼邮件含AI生成内容的比例
KnowBe4《2025 Phishing Threat Trends Report》(2024.9–2025.2样本)
255.3亿美元
2026年全球AI网络安全市场规模(预计2031年达508.3亿美元)
MarketsandMarkets《AI in Cybersecurity》(CAGR 14.8%)
30.5亿美元
2025年美国BEC(商业邮件诈骗)报告损失(24,768起)
FBI IC3《2025 Internet Crime Report》(2024年为27.7亿美元/21,442起)
488万美元
2024年全球单次数据泄露平均成本(同比上涨10%)
IBM《Cost of a Data Breach Report 2024》
11
2024年全球入侵事件中位驻留时间(十年来首次回升)
Mandiant《M-Trends 2025》
14.8% CAGR
全球AI网络安全市场年复合增长率(2026–2031)
MarketsandMarkets 2026
380万+起
2025年全球钓鱼攻击总量(2023年约496万起为历史峰值)
APWG《Phishing Activity Trends Report》各季度报告汇总
258
2024年泄露事件平均识别(194天)与遏制(64天)周期
IBM《Cost of a Data Breach Report 2024》

2025—2026 AI安全威胁态势矩阵

威胁类型攻击手段影响范围趋势风险等级
提示词注入 直接/间接注入,绕过安全护栏(EchoLeak等零点击漏洞) LLM应用、RAG系统、AI Agent、MCP工具链 ↑ 持续高发(OWASP 2026仍列第1位) 严重
深度伪造欺诈 AI生成语音/视频,身份冒用与社交工程(3秒音频即可克隆声音) 金融、政务、企业BEC;香港Arup单案损失2亿港元 ↑ 快速增长(美国2025年深伪欺诈损失约11亿美元) 严重
AI生成钓鱼 LLM生成高逼真钓鱼邮件,多语言/多场景/多态变形 企业邮箱、SaaS平台;82.6%钓鱼邮件含AI内容 ↑ 已成为主流生产方式 高危
Agent供应链攻击 MCP/Skill文件投毒,恶意工具调用(ClawHub约12%为恶意skills) 编码Agent、自动化工作流、AI工具链(LiteLLM/Trivy事件) ↑ 2026年集中爆发 高危
过度代理 Agent权限滥用、误删生产数据、被诱导执行恶意操作(GTG-1002事件) 企业AI Agent、自动化系统;OWASP 2026升至LLM03 ↑ 排名跃升最快的风险 高危
模型后门 训练数据投毒、权重篡改、神经元编辑 开源模型、HuggingFace生态(已托管超100万个模型) ↑ 隐蔽持久 高危
数据与记忆投毒 RAG知识库污染、Agent记忆注入、偏好数据篡改 检索增强生成、微调模型、多Agent系统 ↑ 攻击面扩大 高危
对抗样本 像素级扰动、多模态对抗、物理世界攻击 图像识别、自动驾驶、语音验证、内容审核 → 技术持续深化 中危

AI安全治理框架体系

跟踪国际权威AI安全框架的最新演进(以下版本与发布时间均经核实),为研究与实践提供标准化指引。

OWASP LLM Top 10(2026版)

OWASP GenAI Security Project · 2026年8月3日发布

首次引入真实事件数据(7,714起事件,6,639起可分类):提示词注入、敏感信息泄露保持前两位;过度代理(Excessive Agency)由第6位跃升至第3位;System Prompt Leakage更名并扩展为Hidden Context Exposure(隐藏上下文暴露);无界消耗升至第6位。2026版还将风险映射到NIST、MITRE ATLAS、CWE及Agentic Top 10。

2025 / 2026 应用层风险

OWASP Agentic Top 10(2026版)

OWASP GenAI Security Project · 2025年12月发布

在Black Hat Europe 2025上由OWASP Agentic Security Initiative发布,经100余名行业专家评审:ASI01 Agent目标劫持、ASI02 工具误用与利用、ASI03 身份与权限滥用、ASI04 Agent供应链漏洞、ASI05 意外代码执行、ASI06 记忆与上下文投毒、ASI07 Agent间不安全通信、ASI08 级联故障、ASI09 人机信任利用、ASI10 流氓Agent。

2026 Agent层风险

MITRE ATLAS

MITRE Corporation

v5.1.0(2025年11月)包含16个战术、84个技术、56个子技术、32项缓解措施与42个真实案例;新增第16个战术"Command and Control"及一批Agent导向技术(LLM Prompt Injection AML.T0051含直接/间接注入子技术、LLM Jailbreak AML.T0054、RAG投毒、工具投毒等);v2026.06(2026年6月)持续扩充智能体攻击技术集。

v5.1.0 / v2026.06 攻击者行为知识库

NIST AI RMF

美国国家标准与技术研究院

《AI风险管理框架(AI RMF 1.0)》于2023年1月发布;配套《生成式AI配置文件(NIST-AI-600-1)》于2024年7月发布,为生成式AI提供差异化风险治理建议;《网络安全框架CSF 2.0》(2024年2月)亦将AI风险纳入组织整体网络风险管理。

1.0 / GenAI Profile 风险管理

中国AI安全治理体系

我国已初步形成覆盖生成式AI服务、深度合成内容、算法推荐的治理框架,以下法规的发布与施行时间均经核实。

《生成式人工智能服务管理暂行办法》

国家网信办等七部门 · 2023年8月15日施行

我国首部生成式AI专门规章,确立"包容审慎、分类分级"监管原则,要求提供具有舆论属性或社会动员能力的生成式AI服务须履行安全评估与算法备案手续;训练数据不得侵害知识产权,需提升数据质量与真实性。

《互联网信息服务深度合成管理规定》

国家网信办等三部门 · 2023年1月10日施行

针对深度合成(含AI换脸、拟声)服务,要求落实信息安全主体责任,对生物识别信息编辑、人脸替换等可能造成公众混淆误认的功能进行显著标识;2025年网信办开展"清朗·整治AI技术滥用"专项行动,重点治理利用AI换脸拟声实施诈骗等问题。

《人工智能生成合成内容标识办法》

国家网信办等四部门 · 2025年9月1日施行

配套强制性国家标准(GB 45438-2025),明确要求对AI生成合成文本、图片、音频、视频等内容添加显式标识(文字/语音提示)与隐式标识(元数据),任何组织和个人不得恶意删除、篡改、伪造、隐匿标识,从内容源头遏制深伪滥用。

《人工智能安全治理框架》1.0

全国网络安全标准化技术委员会(TC260) · 2024年9月发布

提出"以人为本、智能向善"核心理念和包容审慎、确保安全等原则,将AI安全风险分为模型算法安全、数据安全、系统安全、内容安全、认知安全、伦理安全等维度,是我国AI安全治理的基础性文件;TC260同步发布《生成式人工智能服务安全基本要求》(TC260-003)。

代表性研究成果

以下成果均来自可核实的公开发表渠道(顶会论文、arXiv、厂商官方披露),点击标题可在公开渠道检索原文。

Google Project Naptime / Big Sleep

Big Sleep:AI Agent在真实软件中发现可利用漏洞

Google DeepMind与Project Zero合作的大模型漏洞挖掘Agent,2024年11月在SQLite中发现可利用的栈缓冲区下溢漏洞并协助修复;2025年继续在Chromium V8等项目中发现漏洞(如CVE-2025-10892)。

Google Security Blog / Project Zero, 2024–2025

ICSE 2024

Fuzz4All: Universal Fuzzing with Large Language Models

利用LLM的代码理解与生成能力自动合成测试输入,实现对多种语言与格式的通用模糊测试,在多个真实解释器/编译器上取得显著覆盖率提升。

IEEE/ACM 46th International Conference on Software Engineering, 2024

arXiv 2509.07225

All You Need Is A Fuzzing Brain: LLM驱动的自动化漏洞检测与修复

DARPA AIxCC 2025决赛第四名(Texas A&M等高校联合团队)。其网络推理系统(CRS)自主发现28个安全漏洞(含6个此前未知的0-day)并自动修复14个;后续FuzzingBrain V2(2026)在真实开源项目中确认29个0-day。

arXiv, 2025(AIxCC决赛相关论文)

NDSS 2025

PoisonedRAG: 检索增强生成系统的知识库投毒攻击

证明仅需向检索库注入极少量恶意文档,即可在多个公开问答数据集上使RAG系统输出攻击者指定内容(黑盒攻击成功率超过90%),揭示检索增强架构的新型攻击面。

Network and Distributed System Security Symposium, 2025

arXiv 2506.04513

AgentPoison:针对LLM Agent记忆系统的红队研究

Google DeepMind等提出,通过向Agent外部记忆/RAG知识库注入极少量毒化数据,即可在多类真实Agent任务上实现高成功率的目标劫持,且对正常任务性能影响很小,凸显持久化记忆带来的新型风险。

arXiv, 2025

USENIX Security 2021

Extracting Training Data from Large Language Models

Carlini等人证明攻击者可通过查询API从GPT-2等大模型中提取出训练语料中的真实个人隐私文本(地址、电话、姓名等),是"大模型记忆化泄露"领域的奠基性工作。

30th USENIX Security Symposium, 2021

AI安全研究演进路线

从基础能力构建到Agent化智能防御,分阶段推进AI安全研究体系建设(规划性内容,持续滚动修订)。

第一阶段 已完成 2024—2025

基础框架与威胁建模

完成AI安全威胁分类体系构建,持续跟踪OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF等框架演进。建立大模型安全攻防实验环境,完成提示词注入、越狱攻击等基础攻击面的系统性验证。

威胁建模框架跟踪实验环境基线测试
第二阶段 进行中 2025—2026

Agent安全与自动化攻防

聚焦AI Agent安全(OWASP Agentic Top 10 2026)、LLM Agent自动化漏洞挖掘(DARPA AIxCC成果跟踪)、智能Fuzzing、供应链安全(LiteLLM/OpenClaw等真实事件复盘)等前沿方向。建设AI钓鱼生成与检测对抗实验平台,输出系列技术白皮书。

Agent安全自动化审计钓鱼对抗供应链白皮书
第三阶段 规划中 2026—2027

多模态安全与可信AI

扩展至多模态大模型安全(视觉-语言-动作模型)、具身智能安全、可信AI评估体系。结合《人工智能生成合成内容标识办法》实施进展,研究生成内容检测与溯源技术,构建AI安全评测基准与红队测试方法论。

多模态安全具身智能可信评估红队测试内容溯源
第四阶段 规划中 2027—2028

自主防御与生态协同

构建AI驱动的自主安全运营能力,实现从威胁感知到自动响应的闭环;跟踪AIxCC开源网络推理系统(CRS)在真实开源社区的落地进展,探索跨机构AI威胁情报共享机制。

自主防御自动响应情报共享最佳实践

数据来源与严谨性说明

本专题全部统计数据遵循以下引用原则,欢迎读者逐条核实:

  • 优先权威一手来源:政府与监管机构报告(FBI IC3年度犯罪报告、FTC消费者数据手册、国家网信办公告)、国际组织统计(APWG)、上市公司研究报告(IBM、Mandiant、Microsoft、Google);
  • 学术成果均可检索:论文均给出发表渠道(IEEE S&P、USENIX Security、NDSS、ICSE、OOPSLA、CCS、ICML、ICLR等或arXiv编号),不使用无法核实的"内部数据"或匿名信源;
  • 区分事实与预测:市场规模数据明确标注统计口径与发布机构;厂商预测性数据(如Deloitte对生成式AI欺诈损失的预测)单独标注"预测"字样;
  • 更新机制:页面数据随年度报告发布周期滚动更新,引用数据时请以原始报告版本为准。

免责声明:本专题仅用于安全教育与研究交流。文中涉及的攻击技术描述均以防御为目的作科普性说明,不提供可操作的攻击指引;模拟演练请在授权环境下进行。

AI安全高频问题解答

AI生成的钓鱼邮件能否被100%自动检测?
不能。KnowBe4数据显示82.6%的钓鱼邮件已含AI生成内容,其语法、语境与真实邮件几乎无异。业界共识是:内容检测(含AI检测器)只能作为多层防御的一环,必须叠加身份认证协议(SPF/DKIM/DMARC强制)、行为分析、异常通信检测与人工核验流程。且研究表明AI文本检测器本身并不可靠——斯坦福大学等研究发现主流GPT检测器对非母语写作者存在系统性误判(Liang et al., Patterns, 2023),OpenAI官方AI分类器亦因准确率低已于2023年下线。
深度伪造视频/语音如何鉴别?个人如何防范AI换脸诈骗?
研究表明人类对高质量深伪视频的识别率仅约24.5%,iProov 2025年研究中仅0.1%的受试者能全部识别所有深伪样本,因此"凭肉眼辨别"并不可靠。可靠的防范手段是流程性的:对涉及转账、敏感操作的请求,挂断后通过已知号码回拨核实;企业应建立大额转账双人复核与延迟到账机制;技术上可结合C2PA内容凭证、显式/隐式标识(我国《人工智能生成合成内容标识办法》已于2025年9月1日施行)与深伪检测API。
企业部署AI Agent最大的安全风险是什么?
OWASP LLM Top 10 2026将"过度代理"(Excessive Agency)由第6位升至第3位。当Agent被授予过多权限(文件读写、API调用、代码执行)且缺乏运行时管控时,提示词注入或模型误判即可造成实际损失——2025年Replit AI Agent误删用户生产数据库、Anthropic披露的GTG-1002事件中攻击者操纵AI Agent完成约80–90%的入侵操作,均为标志性案例。核心控制措施:最小权限、工具白名单、高危操作人工审批、开发与生产环境隔离。
AI能否取代人类安全分析师?
短期内不能,定位是"增强"而非"替代"。IBM 2024年报告显示,深度部署安全AI与自动化的组织单次泄露成本平均降低188万美元、识别与遏制周期缩短约98天,效果来自告警分诊、情报关联、初查自动化等"机器擅长"的环节;但复杂事件的研判、权衡决策与责任承担仍需人类分析师。Mandiant M-Trends 2025亦显示,仍有57%的入侵事件由外部(而非企业自身)首次发现,说明检测能力差距远未弥合。
本专题数据多久更新一次?
主要数据源均有固定发布周期:FBI IC3年度报告(每年4月)、IBM泄露成本报告(每年7–8月)、Mandiant M-Trends(每年上半年)、APWG季度报告、OWASP Top 10(年度更新)、Verizon DBIR(每年上半年)。本专题跟随上述周期滚动更新,重大事件(如AIxCC、OpenClaw事件)则即时补充。

参与AI安全研究

欢迎安全研究者、AI工程师、学术机构加入我们的AI安全研究体系,共建智能时代网络安全防线。