一句话看懂:卡内基梅隆大学的研究者发布了 ExploitBench v0.1,用 41 个真实的 V8 引擎漏洞,衡量 LLM 智能体在软件漏洞利用这条”能力阶梯”上能爬到第几级,而不是只看成功或失败。
事件核心:发生了什么
ExploitBench 由卡内基梅隆大学的研究者创建,目标是评估基于大模型的智能体在真实、已加固的软件漏洞上能做到哪一步。它不做二元判定,而是把漏洞利用拆成一条渐进的能力阶梯:从定位到存在漏洞的代码,到触发崩溃,再到构建利用原语,最终到任意代码执行。
评测对象是 Chromium V8 JavaScript 与 WebAssembly 引擎中的 N-day 漏洞(即已有补丁的漏洞),共 41 个,全部为 2024 年及以后报告。测试在默认发布版本上进行,堆沙箱、ASLR、栈保护等缓解机制全部开启。整个利用过程被拆解为 16 个可确定性评分的”flag”,分为五个层级:T5 是覆盖到脆弱代码,T1 是控制流劫持与代码执行。智能体在统一回合预算下运行,每个漏洞跑多个随机种子,评分由确定性判定器完成。Epoch AI 的图表展示的是排行榜上的平均能力指标,即智能体在各随机种子上点亮的 flag 比例。
为什么重要
过去评测大模型的攻防能力,往往只能给出”能不能攻破”的结论,信息量有限。ExploitBench 把过程切片,能看出智能体卡在哪一环:是找不到漏洞点,还是能触发崩溃但构造不出利用原语。这对判断模型的真实推理与规划能力更有参考价值,因为漏洞利用恰恰需要长链条、多步骤的自主决策。
值得注意的是,测试环境是带缓解机制的生产级配置,而非简化靶场。这意味着它衡量的是”真实条件下能走多远”,对安全研究和模型能力评估都更严格。目前公开信息显示,评测结果来自 ExploitBench 公开排行榜。
对用户/开发者/创作者的影响
对安全从业者,这套基准提供了一个可复用的量化坐标,用来跟踪不同大模型在漏洞利用任务上的进展,而不是只依赖个案演示。对开发者和企业,它提醒了一件事:AI 智能体在漏洞挖掘与利用上的自动化程度是在被系统性测量的,防守方同样需要把模型能力纳入威胁模型。对关注大模型能力边界的读者,这类基准把”AI 会不会自主攻破真实软件”这个模糊问题,拆成了可以逐级观察的工程指标。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是排行榜是否会出现明显的层级跃升,比如更多模型稳定进入 T1 层级。二是覆盖的漏洞范围是否会从 V8 扩展到其他目标,例如内核或浏览器其他组件。三是这套评测方法是否会被安全社区采纳为通用参考,进而影响模型发布时的安全评估口径。


