一句话看懂:AI 研究员 Xiuyu Li 指出,后训练时代的模型评测正从“统一标准”走向“众包化”,任何中心化榜单都可能被操纵,而真正前沿的 agent 能力已经开始超越单一 benchmark 的评估范围。
事件核心:发生了什么
Xiuyu Li 在 2026 年 9 月 4 日发布长文,讨论了当前大模型后训练阶段 benchmark(基准测试)的困境与演化方向。他直言“LLM eval 一直是个草台班子”,每家机构都可以自定义评测设置,从调整 temperature、top_p、长度到修改 harness,都存在操作空间。
文中特别提到 Anthropic 的 AA 评测(推测为某个agent能力的官方基准)试图建立相对规范的统一标准,但作者认为这种中心化评测并不 necessarily 合理。与此同时,OSWorld v2、ALE、TB4/TB-Sci 等众包 frontier benchmark 正在兴起,它们试图覆盖更通用、更接近真实职业任务的能力闭包。
核心观点是:任何 benchmark 都会被刷爆,而众包化评测虽然引入更多 noise,却能更真实反映模型在“第三类任务”(正在被 AI 训练的任务,尤其是 Computer Use 场景)上的进展。
为什么重要
这篇文章触及了当前 AI 行业一个真实痛点:当各家模型在传统 reasoning/coding 榜单上分数趋同后,评测体系本身成了竞争武器而非客观尺子。如果沿用中心化评测(如 AA 官方 95% 置信度结果),模型团队会被迫“迎合榜单”而非优化真实体验,导致 CUA(Computer Use Agent)、working 等实际能力的打磨被忽视。
作者进一步判断:众包 benchmark 将越来越商业化,评测领域会在短期内经历洗牌。这一判断对模型厂商、开发者工具链和投资方向都有直接参考价值——谁定义了未来的评测标准,谁就在一定程度上定义了模型优化的方向。
对用户/开发者/创作者的影响
对普通用户而言,不必盲信任何单一榜单分数,尤其是官方自评的 agent 能力指标,实际体验仍是更可靠的判断依据。对开发者来说,选择基模时除了看 AA 分数,也应关注模型在 OSWorld v2、TB-Sci 等众包测试中的表现,因为这些测试更贴近真实的跨步骤、跨工具任务。对创作者或企业采购方,文中观点提示:目前 AI 评测商业化尚未成熟,错题率和 LLM-judge 的不确定性意味着“高分模型”不一定等于“高可用模型”,建议在采购或集成前做小范围真实场景验证。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,后续值得关注三个方向:其一,OSWorld v2、TB4/TB-Sci 等众包 benchmark 是否会像作者预测的那样快速商业化,并建立类似“对错题负责”的反馈机制;其二,各基模厂商是否会在未来数月内,将官方发榜重心从单一 AA 分数转向多维度众包能力展示;其三,评测洗牌是否会影响模型定价或开源策略——如果评测成本上升,小团队参与竞争的窗口可能会进一步收窄。
来源:@sheriyuo


