一句话看懂:Anthropic 宣称其新模型 Opus 5 在 ARC-AGI-3 基准测试中得分是第二名模型的 3 倍,但这条“胜利”推文被业界人士质疑数字异常——可能遗漏了竞争对手模型的配置问题,引发关于 AI 公司营销与基准测试公平性的讨论。
事件核心:发生了什么
2026 年 7 月 24 日(推文发布时间),Anthropic 官方账号 @claudeai 发布推文称,在 ARC-AGI-3(一项要求 AI 模型解决新颖问题的评估)中,Opus 5 的得分是“次优模型的 3 倍”。该声明被开发者 Peter Steinberger 公开质疑,他在 7 月 30 日的推文中讽刺道:“Anthropic 的人在发那条‘胜利’推文之前,就没有人停下来想想为什么数字这么离谱吗?”
争论焦点在于,Anthropic 的比较对象(OpenAI 的模型)可能因配置错误导致分数异常偏低,而 Anthropic 未验证对手的测试条件便直接发布“碾压”式数据。评论中,部分用户认为调试对手模型并非 Anthropic 的责任,也有观点指出 OpenAI 自身应负责检查分数异常。截至目前,Anthropic 与 OpenAI 均未公开回应。
为什么重要
这次争议反映了 AI 行业日益激烈的“基准军备竞赛”问题。当一家公司以绝对倍数差距宣传自身模型时,若忽略对手测试环境的公平性,可能误导公众对模型实际能力的判断。ARC-AGI-3 本身是评估泛化能力的重要基准,如果营销动作削弱了其可信度,整个行业的模型排名标准都会受到质疑。此外,事件也暴露了公司间在公开场合缺乏技术沟通的常态——本该通过私下核对解决的问题,变成了公开的舆论战。
对用户/开发者/创作者的影响
普通用户:需警惕“N 倍于竞品”类宣传语的误导性,同一基准下的分数差异可能源于配置、提示词或硬件环境的不同,而非绝对能力差距。建议参考多个独立评测再做工具选择。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
开发者与 API 调用者:在比较模型性能时,应主动核查基准测试的标准流程(如是否使用官方推荐配置、推理次数、温度参数等),避免被供应商营销数据带偏。若搭建自有评测,建议沿用权威机构(如 ARC 基金会)的规范。
创作者与内容生产者:报道 AI 进展时需保留质疑空间,优先引用多方验证的第三方评测结果,而非厂商单方面声明。可关注 ARC-AGI-3 后续是否会发布官方的标准化测试协议。
值得关注的后续
1. Anthropic 是否回应质疑:若官方承认测试条件未对齐,可能修正分数或补充说明,对 Opus 5 的商业推广策略形成直接影响。
2. OpenAI 的应对措施:被标注为“低分”的模型(推测为 GPT-5.6)是否会重新调整配置并公开重新测试结果,以此维护自身基准形象。
3. 基准透明度变化:ARC-AGI-3 主办方或第三方评测机构可能借此加强测试标准化要求,要求参与方公开完整推理参数,防止类似营销误导再次发生。


