UC Berkeley 团队用 AI Agent 审计 13 个基准,发现 45 个无需解题的满分作弊方案

UC Berkeley RDI 团队用 AI Agent 对 13 个主流评测基准做安全审计,发现 45 种不真正解题也能拿满分的作弊路径。这意味着部分被广泛引用的跑分,可能高估了模型的真实能力。

一句话看懂:UC Berkeley RDI 团队用 AI Agent 对 13 个主流评测基准做安全审计,发现 45 种不真正解题也能拿满分的作弊路径。这意味着部分被广泛引用的跑分,可能高估了模型的真实能力。

事件核心:发生了什么

据 Berkeley RDI 博客披露,该团队构建了一套自动化审计流程,让 AI Agent 去“攻击”评测系统本身,而不是去解题。审计覆盖 13 个基准,共找出 45 个可绕过正常推理、直接获取满分或高分的方案。

这类问题的本质是评测环境本身存在漏洞:例如测试用例可被读取、答案可被反推、评分脚本可被诱导,或通过调用外部工具、检索、猜测格式等方式绕过真正的能力考察。目前公开信息显示,原始链接已无法访问,具体基准名单和漏洞细节仍需以官方后续披露为准。

为什么重要

基准分数是当前大模型竞争的核心货币。无论是开源模型还是闭源模型,厂商发布时都会强调在 MMLU、SWE-bench、Agent 类任务等榜单上的表现,开发者和企业采购也常以此作为选型依据。

如果基准可以被“作弊”,那么跑分就不再等价于能力,整个评测生态的可信度会被动摇。更深一层的问题是:当 AI Agent 被用来评估 AI 时,评测方和被评测方使用的是同一类技术,攻防会长期存在。这会推动行业从静态榜单转向动态、抗攻击的评测方式,也会影响模型训练目标——如果厂商过度优化可被钻空子的指标,实际推理和泛化能力反而可能被牺牲。

对用户/开发者/创作者的影响

对普通用户来说,模型排行榜的参考价值需要打折,选型时更应看具体任务上的实测表现,而不是单一总分。对开发者而言,如果你用公开基准做内部模型评估或微调验证,需要先检查评测流程是否可被模型“钻空子”,尤其是 Agent、工具调用和多轮任务类测试。对企业采购,建议要求供应商提供可复现的真实业务评测,而不是只给榜单截图。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者和 AI 应用团队,这意味着基于基准宣传的产品卖点可能面临质疑,透明披露评测方法和失败案例会逐渐成为信任资产。

值得关注的后续

一是 Berkeley RDI 是否会公开 45 个作弊方案的完整清单和修复建议;二是主流基准维护方是否会跟进修补,推出抗攻击版本;三是模型厂商是否会在发布中主动披露审计结果,把“可信评测”变成新的竞争维度。

来源:Berkeley RDI:Blog(AI 安全与评测)

celebrityanime
celebrityanime
文章: 26143

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注