Arena 实测:GPT-6 Sol (Max) 以 1689 分列 Code Arena: WebDev 第 4 名

Arena 实测显示,OpenAI 的 GPT-6 Sol(Max)在 Code Arena: WebDev 榜单以 1689 分排名第 4,用不到 Claude Opus 5(Max)一半的价格跑出同档成绩,同时刷新了性价比的帕累托前沿。

一句话看懂:Arena 实测显示,OpenAI 的 GPT-6 Sol(Max)在 Code Arena: WebDev 榜单以 1689 分排名第 4,用不到 Claude Opus 5(Max)一半的价格跑出同档成绩,同时刷新了性价比的帕累托前沿。

事件核心:发生了什么

Arena 在实测数据中给出 GPT-6 Sol(Max)的成绩:Code Arena: WebDev 榜单第 4 名,1689 分,混合输入输出计价为每百万 token 8 美元。这一价位下的表现与前排的 Claude Opus 5(Max)相当,成本不到后者的一半;距离榜首 GPT-6 Astra(Max)只差两个位次,而价格约为其五分之一。

与自家上一代 GPT-5.6 Sol(xHigh)相比,GPT-6 Sol(Max)提升了 72 分,后者当时排在第 17 位。细分方向几乎全面上行:Simulations 从第 18 升至第 3,Content Creation 从第 14 升至第 3,Gaming 从第 13 升至第 3,Consumer Product 从第 14 升至第 4,Reference-based design 从第 10 升至第 4,Brand & Marketing 从第 13 升至第 5,Data & Analytics 从第 14 升至第 6。Arena 同时提到,GPT-6 Luna 的实测票数仍在累积,分数待公布。

为什么重要

看点不只是名次,而是价格与能力的组合。WebDev 这类代码竞技场长期由高价位旗舰模型占据前排,而 GPT-6 Sol(Max)把接近头部的能力压到每百万 token 8 美元,直接改写了帕累托前沿的位置——也就是说,在“给定预算能买到多强”的坐标系里,多了一个更靠前的选择。

结合 OpenAI 早前发布 GPT-6 Sol 与 Luna 时的说法,这两款模型复用了 GPT-6 Astra 的部分能力,定位是更快、更便宜、更适合规模化调用,并在缓存与推理效率上做了优化。这释放出一个路线信号:头部实验室的竞争重心,正在从单纯刷榜转向单位算力下的产出效率,闭源旗舰的能力开始以更低的推理成本向中端价位下沉。

对用户/开发者/创作者的影响

对开发者而言,WebDev 分数的提升叠加低价,意味着前端页面生成、原型搭建、组件重构这类高频调用场景的成本明显下降,更适合接入 API 做批量任务,而不是只在关键节点手动调用一次。对创作者和产品团队,Content Creation、Consumer Product、Brand & Marketing 等分类进入前五,说明它在营销文案、落地页、交互原型上的可用性比上一代更强。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购来说,同等预算下可选的能力档位变多,“用最贵模型兜底、其余交给中端模型”的分层调用策略会更有性价比。不过目前公开信息显示,这些结论主要来自 Arena 的真实用户投票,尚缺少覆盖长链路工程任务的独立评测,实际稳定性仍需验证。

值得关注的后续

一是 GPT-6 Luna 的实测分数,若同样落在前列,OpenAI 在性价比区间会形成双点覆盖。二是价格是否随推理成本下降继续调整,以及缓存优化能否在 API 计费中体现。三是 Claude、Google 等竞品是否跟进该价位段,July 后的榜单格局值得持续观察。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 25274

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注