GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,以更低成本逼近前列模型

GPT-6.1 Sol (Max) 首次进入 Agent Arena 就排到第 5 名,单任务中位成本仅 0.56 美元,用明显更低的价格把性能压到头部模型 2 个百分点以内,重新划定了成本与能力的性价比边界。

一句话看懂:GPT-6.1 Sol (Max) 首次进入 Agent Arena 就排到第 5 名,单任务中位成本仅 0.56 美元,用明显更低的价格把性能压到头部模型 2 个百分点以内,重新划定了成本与能力的性价比边界。

事件核心:发生了什么

据 Arena 在 X 上发布的信息,OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 后排名第 5,较此前提升 11.23%,并改写了该榜单的帕累托前沿。核心数据是成本:它完成单个任务的中位成本为 0.56 美元,而性能与 GPT-6 Sol、GPT-6 Astra 的差距都在 2 个百分点以内。具体来看,它比 GPT-6 Sol 便宜 39%,得分反而高出 1.52 分;比 GPT-6 Astra 便宜 81%,分差仅 1.04 分。横向对比 Claude 系列同样如此:比排名第 1 的 Claude Fable 5.1 (Max) 低 88% 成本、分差 3.08 分;比第 2 的 Claude Opus 5.5 (High) 低 65%、分差 2.59 分;比第 3 的 Claude Sonnet 5.5 (Max) 低 80%、分差 1.29 分。Arena 此前还提到,该模型在 Code Arena: WebDev 中排到第 3,得分 1759,混合价格约每百万 token 8 美元。

为什么重要

这组数字的意义不在“又发了一个新模型”,而在于性价比曲线的移动。Agent Arena 衡量的是多步骤任务的实际完成能力,直接对应 API 调用成本。当第 5 名的模型只花头部模型五分之一到十分之一的钱,企业做 Agent 应用的边际成本会明显下降。更关键的是,榜单前几名目前由 Claude 系和 OpenAI 系交替占据,GPT-6.1 Sol 以低价切入前五,等于把价格战从“聊天对话”推到了“能干活的任务型 Agent”这一层。对闭源厂商来说,能否在维持性能的同时压低推理成本,正在变成比单点跑分更硬的竞争维度。

对用户/开发者/创作者的影响

对开发者,0.56 美元的中位任务成本意味着做长链路 Agent、批量网页操作、自动化工作流的试错门槛降低,很多此前“跑得起但不敢多跑”的场景可以重新算账,比如代码生成、网页开发辅助、多轮工具调用。对企业和采购方,榜单排名接近而价差数倍,会促使他们按任务类型混合调度模型,而不是全部押注单一最强模型。对创作者,成本下降通常先反映在第三方 AI 应用订阅价和免费额度上,但短期更可能体现为工具内部能力变强,而非直接降价。需要注意的是,Arena 的得分和成本都是特定评测条件下的数据,目前公开信息显示,它并不等同于所有真实业务场景的表现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 GPT-6.1 Sol 的 API 定价与限速是否正式公布,这决定开发者能否真正用起来;二是 GPT-6 Sol、GPT-6 Astra 以及 Claude 系是否跟进调价或推出更便宜的档位;三是 Agent Arena 的评测口径与任务分布是否公开,避免单一榜单被过度解读。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 26986

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注