Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,净提升 +7.92%

Google DeepMind 的 Gemini 4 Argon (High) 在 Arena 的 Agent Arena 榜单上位列第 8,净提升 +7.92%,并凭每任务 0.62 美元的成本重画了性价比边界。这意味着谷歌新一代模型在真实 agent 任务上的表现和成本控制同时往前迈了一步。

一句话看懂:Google DeepMind 的 Gemini 4 Argon (High) 在 Arena 的 Agent Arena 榜单上位列第 8,净提升 +7.92%,并凭每任务 0.62 美元的成本重画了性价比边界。这意味着谷歌新一代模型在真实 agent 任务上的表现和成本控制同时往前迈了一步。

事件核心:发生了什么

根据 Arena 公布的信息,Gemini 4 Argon (High) 在 Agent Arena 上排名第 8,净提升分数为 +7.92%。相比此前排在第 19、净提升 +2.96% 的 Gemini 3.8 Flash (High),这次提升了 4.96 个百分点。同时,它以每任务 0.62 美元的成本重塑了该榜单的帕累托前沿,也就是在效果与价格之间找到了新的更优组合。

细分信号上,Gemini 4 Argon (High) 在 Steerability(用户提出反驳后模型纠偏的能力)上排第 1,提升 +15.88%;在 Confirmed Success(用户明确反馈任务成功)上排第 2,提升 +14.15%;在 Praise vs Complaint(用户反应中的隐含情绪)上排第 4,提升 +27.74%。按类别看,它在 Chat 场景尤为突出,以 +11.58% 的净提升排到第 3。Arena 也说明,目前这些分数基于约 3 千个真实 agent 会话,属于初步结果。

为什么重要

Agent Arena 衡量的是模型在真实任务里的执行效果,而不是单纯的语言能力。Gemini 4 Argon (High) 这次进入前十,说明谷歌在“能干活”的 agent 方向上有实质进步。更关键的是 0.62 美元每任务的成本,直接改变了性价比曲线——对企业采购和开发者选型来说,效果接近时成本往往是决定因素。

Steerability 和 Confirmed Success 两项靠前,也指向一个行业趋势:模型不只要一次做对,还要在用户反馈后愿意改、改得动。这恰恰是 agent 落地到客服、编程、办公自动化等场景的核心门槛。此外,同一发布中 Gemini 4 Argon (High) 还在 Text Arena 拿到 1525 分排第 1,在 Code Arena: WebDev 拿到 1679 分排第 8,并在文本竞技场以约 8 美元每百万 token 的混合价格成为高性价比选项,显示出谷歌在多个榜单上的同步发力。

对用户/开发者/创作者的影响

对开发者而言,Steerability 排名靠前意味着在 API 里做多轮纠偏、工具调用和流程编排时,模型更可能顺着反馈调整,而不是固执重复错误,这会降低调试成本。每任务 0.62 美元的成本信号,则让高频 agent 任务在预算上更可算。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业和内容创作者来说,Chat 场景排第 3 说明日常对话、文案辅助、信息整理类应用可以优先试用。不过要注意,目前只有约 3 千个会话的样本,分数可能随更多轨迹加入而波动,暂不适合据此做长期采购决策。创作者若用它做自动化工作流,建议先用真实业务任务小规模验证,再决定是否接入生产环境。

值得关注的后续

一是样本扩大后排名是否稳定。Arena 明确表示当前分数是初步的,随着全球用户更多真实会话进入,第 8 名和 +7.92% 的净提升能否守住是关键观察点。

二是成本能否维持。0.62 美元每任务重塑了帕累托前沿,如果后续定价或推理成本变化,这个优势可能被竞品追平。

三是竞品跟进。OpenAI、Anthropic 等是否会在 Agent Arena 上推出对标版本,以及谷歌是否把这一代模型能力开放到更多 API 和产品线中,都会影响开发者的实际可用性。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 26606

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注