CheckerBench 发布:300 个静态分析检查器任务,顶级智能体通过率仅 45%

Hugging Face Papers 收录的 CheckerBench 提出 300 个从真实 CVE 衍生的静态分析检查器合成任务,用于衡量编码智能体能否完整走完从读规范、看仓库到实现并反复调试的分析器开发流程。目前公开信息显示,表现最好的配置首轮通过率也只有 45.33%,说明这类长周期任务对现有智能体…

一句话看懂:Hugging Face Papers 收录的 CheckerBench 提出 300 个从真实 CVE 衍生的静态分析检查器合成任务,用于衡量编码智能体能否完整走完从读规范、看仓库到实现并反复调试的分析器开发流程。目前公开信息显示,表现最好的配置首轮通过率也只有 45.33%,说明这类长周期任务对现有智能体仍然很难。

事件核心:发生了什么

根据论文摘要,研究团队发布了 CheckerBench,一个可执行的基准测试,包含 300 个任务,来自 297 个 CVE、167 个代码仓库、85 类 CWE 和 5 种语言生态。每个任务都配有脆弱版本与修复版本、固定版本的分析环境以及检查器脚手架,要求智能体先理解缺陷规范,再检查代码仓库,写出对应分析器的逻辑,并借助反复编译和分析反馈来改进检查器。同时发布的还有 CheckerLab 评测框架,它会独立重建提交的检查器,并衡量脆弱-修复诊断对比、补丁定位、误报和工具使用等指标。

论文摘要给出的结果是,在 21 种模型与工具组合配置、每种配置独立重复三次的条件下,平均 Pass@1 为 32.30%,最好成绩为 45.33%。这些数据仅适用于 CheckerBench 当前的任务集和评测条件,不应被理解为对模型能力的永久排名。

为什么重要

现有编码智能体基准多集中在补丁生成或漏洞检测,很少检验智能体能否从头到尾做出一个可用的检查器。CheckerBench 把任务拉长到“缺陷规范—仓库理解—分析器实现—编译反馈—迭代修正”的完整链条,更接近真实安全工具开发的工作方式。它给出的信号是:即便大模型在单点编码任务上表现不错,面对需要长期规划和工具反馈的静态分析器合成,可靠性依然有限。

对用户/开发者/创作者的影响

对安全团队和代码审计开发者来说,这类基准可能推动更贴近实战的智能体评测方式,而不是只看漏洞识别率。对企业采购方,CheckBench 的结果提示:把分析器开发整体交给智能体尚不成熟,更现实的路径是让智能体承担脚手架搭建、初步逻辑实现和误报筛选,人类负责最终校验。对开源社区,CheckerLab 这类独立重建检查器的评测框架,如果能公开落地,有助于比较不同模型和工具链的实际工具使用能力。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息仅基于论文摘要,后续可关注三点:一是 CheckerBench 和 CheckerLab 是否开源并允许第三方复现;二是评测是否加入更多语言生态、真实仓库规模和更新后的 CVE;三是智能体在误报控制、补丁定位和迭代调试上的短板,是否会被新的工具调用或训练方法针对性改进。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 27906

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注