Artificial Analysis 推出网络安全指数联盟,评测AI代理防御能力

Artificial Analysis 联合 Collinear AI、IBM、NVIDIA、Vercel 发起 Cyber Index Alliance,并发布 Cyber Index,用三套基准评测 AI 模型在企业网络安全防御任务中的真实表现。

一句话看懂:Artificial Analysis 联合 Collinear AI、IBM、NVIDIA、Vercel 发起 Cyber Index Alliance,并发布 Cyber Index,用三套基准评测 AI 模型在企业网络安全防御任务中的真实表现。

事件核心:发生了什么

2026 年 9 月 28 日,AI 评测机构 Artificial Analysis 宣布成立 Cyber Index Alliance,并同步上线 Artificial Analysis Cyber Index。该指数由三个评测集组成:Collinear AI 贡献的 CWE-Bench-AA、Vercel 贡献的 DeepsecBench-AA,以及来自 Berkeley RDI 的 CyberGym-E2E-AA。CWE-Bench-AA 覆盖 120 个隔离任务,对应 OWASP Top 10(2025)全部十类;CyberGym-E2E-AA 包含 131 个任务,考察 C/C++ 开源项目中内存安全漏洞的发现、复现与修复。评测只基于源码审计,不要求模型生成可用的攻击代码。IBM 和 NVIDIA 以方法学专家身份加入联盟。

为什么重要

AI 模型在代码审计和漏洞修复上的能力正在成为企业安全团队的实际选型依据。此前安全评测多为一次性学术榜单,缺少与成本挂钩的持续比较。Cyber Index 把「发现、复现、修补」这一防御闭环拆成可量化的子能力,并公开每任务成本,让安全采购方能在能力与推理开销之间做权衡。联盟模式也值得注意:评测集来自产业方和学术机构,由中立机构统一运营,这比单一厂商自建榜单更难被操纵。目前公开信息显示,该指数关注的是防御端,不涉及攻击性能力评测。

对用户/开发者/创作者的影响

对企业安全团队和平台工程负责人,Cyber Index 提供了一个可比的模型选型参考,尤其适合评估用 AI 代理做代码库漏洞扫描和补丁生成的性价比。对开发者而言,该指数强调补丁不能破坏既有功能,意味着模型输出需要经过测试验证,不能直接合入生产分支。对安全工具厂商,CWE-Bench-AA 和 DeepsecBench-AA 作为私有保留集参与评测,可能推动更多厂商贡献数据或接入联盟。目前榜单结果仅适用于原文发布时的模型和评测条件,不构成长期排名。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,联盟是否会扩充更多模型厂商和安全公司,评测集是否持续更新以覆盖新漏洞类型。第二,Cyber Index 是否加入事件响应、日志分析等更多防御环节,素材提到计划扩展但尚未落地。第三,企业采购是否会将该指数纳入安全预算决策,以及模型定价变化后成本曲线是否重排。感兴趣的组织可通过 cyber@artificialanalysis.ai 申请加入联盟。

来源:Artificial Analysis

celebrityanime
celebrityanime
文章: 27889

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注