读知乎回答有感,浅谈一下后训练 benchmark https://t.co/wA8Q06vZVe Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 tempera…

AI 研究员 Xiuyu Li 指出,后训练时代的模型评测正从“统一标准”走向“众包化”,任何中心化榜单都可能被操纵,而真正前沿的 agent 能力已经开始超越单一 benchmark 的评估范围。

一句话看懂:AI 研究员 Xiuyu Li 指出,后训练时代的模型评测正从“统一标准”走向“众包化”,任何中心化榜单都可能被操纵,而真正前沿的 agent 能力已经开始超越单一 benchmark 的评估范围。

事件核心:发生了什么

Xiuyu Li 在 2026 年 9 月 4 日发布长文,讨论了当前大模型后训练阶段 benchmark(基准测试)的困境与演化方向。他直言“LLM eval 一直是个草台班子”,每家机构都可以自定义评测设置,从调整 temperature、top_p、长度到修改 harness,都存在操作空间。

文中特别提到 Anthropic 的 AA 评测(推测为某个agent能力的官方基准)试图建立相对规范的统一标准,但作者认为这种中心化评测并不 necessarily 合理。与此同时,OSWorld v2、ALE、TB4/TB-Sci 等众包 frontier benchmark 正在兴起,它们试图覆盖更通用、更接近真实职业任务的能力闭包。

核心观点是:任何 benchmark 都会被刷爆,而众包化评测虽然引入更多 noise,却能更真实反映模型在“第三类任务”(正在被 AI 训练的任务,尤其是 Computer Use 场景)上的进展。

为什么重要

这篇文章触及了当前 AI 行业一个真实痛点:当各家模型在传统 reasoning/coding 榜单上分数趋同后,评测体系本身成了竞争武器而非客观尺子。如果沿用中心化评测(如 AA 官方 95% 置信度结果),模型团队会被迫“迎合榜单”而非优化真实体验,导致 CUA(Computer Use Agent)、working 等实际能力的打磨被忽视。

作者进一步判断:众包 benchmark 将越来越商业化,评测领域会在短期内经历洗牌。这一判断对模型厂商、开发者工具链和投资方向都有直接参考价值——谁定义了未来的评测标准,谁就在一定程度上定义了模型优化的方向。

对用户/开发者/创作者的影响

对普通用户而言,不必盲信任何单一榜单分数,尤其是官方自评的 agent 能力指标,实际体验仍是更可靠的判断依据。对开发者来说,选择基模时除了看 AA 分数,也应关注模型在 OSWorld v2、TB-Sci 等众包测试中的表现,因为这些测试更贴近真实的跨步骤、跨工具任务。对创作者或企业采购方,文中观点提示:目前 AI 评测商业化尚未成熟,错题率和 LLM-judge 的不确定性意味着“高分模型”不一定等于“高可用模型”,建议在采购或集成前做小范围真实场景验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,后续值得关注三个方向:其一,OSWorld v2、TB4/TB-Sci 等众包 benchmark 是否会像作者预测的那样快速商业化,并建立类似“对错题负责”的反馈机制;其二,各基模厂商是否会在未来数月内,将官方发榜重心从单一 AA 分数转向多维度众包能力展示;其三,评测洗牌是否会影响模型定价或开源策略——如果评测成本上升,小团队参与竞争的窗口可能会进一步收窄。

来源:@sheriyuo

celebrityanime
celebrityanime
文章: 22021

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注