Artificial Analysis:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 登顶 Coding Agent Index 榜单但成本差异大

Artificial Analysis 的 Coding Agent Index 本周迎来三款新模型同时冲上榜首区间,但它们的单任务成本相差最高达十倍以上——性能排名接近,价格却完全不在一个量级。

一句话看懂:Artificial Analysis 的 Coding Agent Index 本周迎来三款新模型同时冲上榜首区间,但它们的单任务成本相差最高达十倍以上——性能排名接近,价格却完全不在一个量级。

事件核心:发生了什么

据 Artificial Analysis 公布的信息,本周 Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 三款新模型分别在 Claude Code、Codex 和 Antigravity CLI 中接入后,同时进入 Coding Agent Index 榜单前列。该指数衡量的不是单个模型,而是“模型 + 运行框架(harness)”组成的 Agent 在三个编程类评测中的综合表现。

具体数据为:Claude Sonnet 5.5(max 档)在 Claude Code 中以 68 分登顶,但单任务实测成本最高,为 14.19 美元;Gemini 4 Argon(high 档)在 Antigravity CLI 中得 64 分,单任务成本 5.84 美元,不到 Sonnet 5.5 的一半,不过该价格基于谷歌的促销定价,且 Argon 目前尚未公开发布;GPT-6.1 Sol(xhigh 档)在 Codex 中得 63 分,单任务成本仅 1.04 美元,约为 Argon 的六分之一。

为什么重要

这组数据把编程 Agent 竞争的焦点从“谁更聪明”转向了“谁更划算”。三款模型的得分差距只有 5 分,但成本差距超过 13 倍,说明当前头部模型的编程能力已经进入贴身缠斗阶段,真正的差异化开始落在推理效率、token 消耗和框架优化上。对厂商而言,卖点不再只是榜单名次,而是在同等任务下能省多少算力预算。这也解释了为什么 Artificial Analysis 强调指数测的是“模型 + harness”组合——同一个模型换一个运行框架,成本和表现都可能明显变化,工具链的工程能力正在成为竞争变量。

对用户/开发者/创作者的影响

对开发者来说,选择编程 Agent 时不能只看排行榜首。GPT-6.1 Sol 在 Codex 中的性价比明显更高,适合高频、批量调用 API 或长周期自动化任务的场景;Claude Sonnet 5.5 分数领先,但单任务 14 美元级的成本更适配合规要求高、任务复杂度大、对结果质量敏感的关键项目。企业采购时,建议把“每任务成本”与“任务通过率”一起折算成有效成本,而不是单看单价。需要提醒的是,Gemini 4 Argon 尚未公开可用,其价格和表现目前只能作为参考,短期内不宜纳入正式技术选型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Gemini 4 Argon 正式公开发布后的定价是否维持当前促销水平;二是 Claude 与 OpenAI 是否针对成本差距调整档位策略或推出更省 token 的运行模式;三是 Coding Agent Index 这类“模型 + 框架”综合评测是否会成为开发者选型的主流参考标准。目前公开信息显示,三款模型的完整评测细节和长期稳定性数据仍有限,值得继续跟踪。

来源:X:Artificial Analysis (@ArtificialAnlys)

celebrityanime
celebrityanime
文章: 26818

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注