Artificial Analysis 评测 Gemini 4 Argon,智能指数追平 GPT-6 Astra 且成本仅 60%

Artificial Analysis 评测显示,Google 新模型 Gemini 4 Argon 在高推理档位下智能指数达到 53,追平 GPT-6 Astra(max,53),且在五折促销与缓存折扣加码下,单任务成本仅为后者的 60%。这意味着 Google 重新回到智能水平前三。

一句话看懂:Artificial Analysis 评测显示,Google 新模型 Gemini 4 Argon 在高推理档位下智能指数达到 53,追平 GPT-6 Astra(max,53),且在五折促销与缓存折扣加码下,单任务成本仅为后者的 60%。这意味着 Google 重新回到智能水平前三。

事件核心:发生了什么

据 Artificial Analysis 在 X 上发布的信息,Gemini 4 Argon 是 Google DeepMind 七个多月来首个高于 Flash 级别的自研闭源模型。在高推理档位下,它在 Artificial Analysis 智能指数上拿到 53 分,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分,比 Google 上一代非 Flash 模型 Gemini 3.1 Pro Preview(30 分)高出 23 分。目前该模型仅向部分用户推送,尚未公开发布。

成本方面,在现行 50% 折扣与缓存输入 95% 折扣下,Argon 每完成一个智能指数任务约花费 1.99 美元,相当于 GPT-6 Astra(max,3.26 美元)的 60%,但仍是 GPT-6.1 Sol(max)的 2.7 倍。折扣结束后预计升至 3.98 美元,约合 Astra 的 1.2 倍。其定价标准为每百万输入/输出 token 4/20 美元,上下文窗口 1M,支持文本、图像、视频和语音输入,输出为文本。

为什么重要

这组数据显示 Google 在高智能模型这一档重新具备竞争力。此前 Google 在非 Flash 级模型上明显落后,如今 Argon 追平 GPT-6 Astra,说明头部闭源模型的智能差距正在收窄,竞争焦点从“谁更聪明”转向“同等智能下的成本与稳定性”。同时,Argon 的较低幻觉率(15%,是智能指数 45 分以上模型中最低)和明显增强的代理能力,指向大模型在真实任务中的可用性,而非单纯刷榜分数。对行业而言,促销价的成本优势会进一步压缩竞品的定价空间。

对用户/开发者/创作者的影响

开发者可以关注 Argon 的三点实际影响:一是 1M 上下文与多模态输入,适合长文档、图像/视频理解类 AI 应用;二是新增的 Long Decode Continuation API 特性,允许长回复跨多次调用续写,推理输出最长可到 1M token,减少超时中断,对需要长链推理的代理任务更友好;三是缓存输入 95% 折价,重复上下文为主的场景能明显压低调用开销。不过促销结束后成本上升,开发者需要按标准价重新评估预算。对普通用户和创作者来说,目前该模型尚未公开可用,暂时无法直接选用,但可以预期其能力会逐步下放到 Gemini 面向消费者的产品线中。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Google 何时确认促销结束日期,标准价下 Argon 的成本优势将明显收窄;二是模型何时从部分用户扩大到公开 API 或消费者产品;三是 OpenAI 与 Anthropic 是否在成本或代理能力评测上跟进反制。目前公开信息显示,上述评测分数均来自 Artificial Analysis 的第三方基准,实际使用表现仍需更多独立验证。

来源:X:Artificial Analysis (@ArtificialAnlys)

celebrityanime
celebrityanime
文章: 26579

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注