- 简介人工智能代理正迅速提升其能力,可能深刻重塑网络安全格局,因此亟需开展严谨的评估。其中一项关键能力是“漏洞利用”(exploitation):即把一个尚不具备攻击性质的漏洞,转化为具有实际安全影响的具体攻击行为,例如未授权访问文件或执行任意代码。漏洞利用是一项极具挑战性的任务,因为它不仅要求对程序进行底层推理(例如理解内存布局),还需在运行时动态调整策略,并在较长的任务周期内持续取得进展。与此同时,该能力天然具有“双重用途”特性——既可支撑防御性工作流程,也会降低攻击者的实施门槛。尽管漏洞利用至关重要,且对评估模型能力具有极高的诊断价值,目前却仍缺乏系统性的评测。为填补这一空白,我们推出了ExploitGym:一个面向人工智能代理漏洞利用能力的大规模、多样化、高保真基准测试平台。给定一个可触发漏洞的程序输入,ExploitGym要求代理逐步扩展该输入,最终构造出一个完整可用的漏洞利用载荷(working exploit)。该基准共包含898个实例,全部源自真实世界中的安全漏洞,覆盖三大领域:用户态程序、谷歌V8 JavaScript引擎以及Linux内核。我们对每个实例施加不同组合的安全防护机制(如ASLR、Stack Canary、SMAP等),以独立评估各类防护措施对代理性能的实际影响。所有测试配置均封装于可复现的容器化环境中。我们的评估结果表明,尽管漏洞利用仍属高难度任务,当前前沿大模型已能成功利用相当比例的真实漏洞。例如,表现最强的两个配置分别为Anthropic公司最新发布的Claude Mythos Preview模型与OpenAI的GPT-5.5模型,二者分别成功生成了157个和120个可用的漏洞利用载荷。尤为值得注意的是,即便在启用业界广泛部署的各类安全防护机制的情况下,模型依然保持了不可忽视的成功率。这些结果充分验证了ExploitGym作为漏洞利用能力评测平台的有效性,同时也凸显出日益强大的人工智能代理所带来的不断加剧的网络安全风险。
-
- 图表
- 解决问题论文旨在系统性评估AI代理在真实软件漏洞 exploitation(利用)任务上的能力,解决当前AI安全评估中对‘从漏洞触发到实际攻击链构建’这一关键、高风险、长程推理能力缺乏标准化、规模化、现实化基准的问题。这不是全新问题,但此前缺乏覆盖多领域(userspace/V8/kernel)、带真实防护配置、容器化可复现的exploitation专用基准。
- 关键思路提出ExploitGym:一个大规模、多样化、真实世界漏洞驱动的AI代理exploitation能力基准。核心创新在于将exploitation建模为‘渐进式输入扩展任务’——给定触发漏洞的初始输入,要求AI代理自主生成能绕过现代防护(如ASLR、SMAP、SMEP、CFG等)并达成具体安全影响(如RCE、arbitrary read)的完整exploit payload。所有实例均封装为可复现的Docker环境,并显式控制安全缓解措施以归因分析。
- 其它亮点包含898个来自真实CVE、CISA KEV及Project Zero的漏洞实例,覆盖Linux userspace、Google V8引擎、Linux kernel三大高价值领域;首次在统一框架下量化前沿闭源模型(Claude Mythos Preview, GPT-5.5)的exploit成功率(157/120 out of 898),即使启用主流内核防护仍保持非零成功率;全部环境容器化、配置可复现、漏洞上下文完整;强调exploitation的双用途性与紧迫防御需求;代码与环境已开源(https://github.com/ExploitGym/ExploitGym);值得深入的方向包括:exploitation过程的可解释性追踪、防御感知的对抗性强化训练、面向红蓝对抗的agent-to-agent exploit-defense闭环。
- ‘CyberSecEval 2’ (Microsoft, 2023); ‘SafeCoder’ (Anthropic, 2024); ‘HackerGym’ (UC Berkeley, 2023, focused on CTF-style binary exploitation but not real-world CVEs or kernel/V8); ‘LLM4Pwn’ (USENIX Security ’24, exploit generation for web apps); ‘VulnLLM’ (ACL ’24, vulnerability detection only, no exploitation)


提问交流