研究LLM Agent驱动的自动化代码审计、智能Fuzzing种子生成、符号执行增强、静态分析误报压缩等技术,探索AI在0-day漏洞发现中的能力边界。
软件漏洞是网络安全的根本源头。公开数据显示,2025年全球披露的CVE数量已接近5万个,而传统漏洞挖掘依赖安全专家的人工审计与经验积累,成本高、周期长、覆盖有限。人工智能——特别是大语言模型(LLM)与LLM Agent的兴起,正在从根本上改变漏洞发现的范式:从"人找漏洞"转向"AI辅助发现"乃至"AI自主发现"。
里程碑式验证来自两条主线:其一是DARPA AI Cyber Challenge (AIxCC)——2025年8月DEF CON 33决赛上,7支决赛队伍的网络推理系统(CRS)在约5,400万行真实开源代码中发现54/63个植入的合成漏洞(识别率86%)、修复43个(修复率68%),并在真实代码中发现18个0-day(修复11个);其二是Google的Project Naptime/Big Sleep——2024年11月,该AI Agent在广泛使用的SQLite中发现了一个可利用的栈缓冲区下溢漏洞,这是AI在真实广泛部署软件中发现可利用漏洞的首个公开案例,2025年又扩展到Chromium V8等目标(CVE-2025-10892)。
核心洞察:LLM在漏洞挖掘中的核心价值不在于替代传统程序分析技术,而在于弥合高层语义理解与底层程序分析之间的鸿沟——将自然语言描述的安全规则转化为精确的代码查询、定向测试生成与可利用性判断。
覆盖率引导的代表:AFL(2013)、AFL++、libFuzzer、Honggfuzz;内核专用:syzkaller;持续化平台:Google OSS-Fuzz(2016年启动)与ClusterFuzz。OSS-Fuzz已对数百个开源项目持续 fuzz 多年,累计帮助修复上万计漏洞。
KLEE(Cadar et al., OSDI 2008):基于LLVM的符号执行引擎,自动生成高覆盖测试;SAGE(Microsoft,2008–2012):白盒模糊测试工业化的代表,在Office等产品线上发现大量安全漏洞;angr(Shoshitaishvili et al., USENIX Security 2016):二进制分析平台,将符号执行用于固件与闭源程序审计。
Semgrep(规则即代码,社区规则库庞大)、GitHub CodeQL(QL查询语言,将缺陷建模为数据流查询)、Joern(代码属性图CPG遍历)。传统痛点是误报率高——这正是LLM可以发挥"语义消歧"作用的环节。
LAVA-M(NDSS 2016,大规模注入已知bug的基准)、MAGMA(NDSS 2020)、Google FuzzBench(持续 fuzzer 基准平台)、NIST Juliet/SARD测试套件、CVE/NVD与CWE Top 25。评估AI漏洞挖掘能力必须以基准先行,避免"演示式成果"误导。
LLM理解代码语义与安全规则,定位可疑source/sink与危险API用法,生成候选漏洞假设。
自动生成harness与种子(Fuzz4All);面向协议实现由文档生成测试(NDSS 2024 LLM协议fuzzing);内核驱动交互生成(KernelGPT, ASPLOS 2025)。
LLM阅读崩溃栈与触发输入,判断根因类型(内存破坏/逻辑错误/空指针等),聚类去重,压缩分析师工作量。
判断崩溃是否可被利用(控制流劫持、信息泄露),自动生成最小触发用例——AIxCC要求CRS自动出具结构化漏洞证明。
生成候选补丁、回归测试并验证修复不引入新问题(AIxCC决赛修复率68%);端到端闭环是当前前沿方向。
| 成果 | 发表/出处 | 核心贡献 | 关键结果 |
|---|---|---|---|
| Big Sleep | Google Project Naptime(DeepMind×Project Zero) | LLM Agent自主发现并利用漏洞 | 2024年11月在SQLite中发现可利用栈缓冲区下溢;2025年发现V8漏洞(CVE-2025-10892) |
| Fuzz4All | ICSE 2024 | LLM驱动的通用多语言模糊测试 | 自动生成输入并适配多种语言处理器,显著提升覆盖率 |
| LLM-guided Protocol Fuzzing | NDSS 2024 | 仅依协议文档生成测试用例 | 对主流协议实现发现真实漏洞,降低协议审计门槛 |
| LLMs are Zero-Shot Fuzzers | ISSTA 2023(Deng et al.) | 用LLM直接生成测试输入 | 在深度学习库等目标上,由通用提示即可发现输入有效性错误 |
| CodaMosa | ICSE 2023 | LLM与覆盖引导混合模糊测试 | 代码覆盖停滞时由LLM探索新输入类型 |
| WhiteFox | OOPSLA 2024 | LLM增强的编译器/语言实现测试 | 在GCC等成熟目标上发现此前遗漏的缺陷 |
| KernelGPT | ASPLOS 2025 | 内核fuzzing harness自动合成 | 面向Linux内核驱动交互自动生成测试桩 |
| FuzzingBrain | arXiv:2509.07225(AIxCC 2025决赛第4名) | LLM作为编排器的自主漏洞检测与修复系统 | AIxCC中自主发现28个漏洞(含6个0-day)、修复14个;V2(2026)在真实部署中确认29个0-day |
| DARPA AIxCC 2025决赛 | DEF CON 33(2025.8) | 端到端自动发现+修复竞赛 | 7支决赛队伍在约5,400万行代码中发现54/63个合成漏洞、修复43个,另发现18个真实0-day;冠军Team Atlanta(400万美元)、亚军Trail of Bits(300万美元)、季军Theori(150万美元) |
当前能力边界
关键挑战