Gemini 4 Argon 在早期测试中与 GPT-6 Astra 表现相当,幻觉问题明显更少

Google 的 Gemini 4 Argon 在独立评测机构 Artificial Analysis 的早期测试中追平 OpenAI 的 GPT-6 Astra,且幻觉率显著更低,但目前仅向少数网络安全防御者开放,尚未对公众和企业大规模可用。

一句话看懂:Google 的 Gemini 4 Argon 在独立评测机构 Artificial Analysis 的早期测试中追平 OpenAI 的 GPT-6 Astra,且幻觉率显著更低,但目前仅向少数网络安全防御者开放,尚未对公众和企业大规模可用。

事件核心:发生了什么

Google 于本周三发布 Gemini 4 Argon,但只提供给一小批网络安全防御人员使用。据 Artificial Analysis 测试,Argon 在智能指数上得 53 分,与 GPT-6 Astra 持平,比 GPT-6.1 Sol 高 1 分,落后 Anthropic Claude Opus 5.5 的 58 分。相比 Google 上一款 Flash 级别以上的模型 Gemini 3.1 Pro Preview,Argon 高出 23 分,被评测机构认为让 Google 重回前三实验室行列。

幻觉控制是 Argon 最突出的差异点:在 AA-Omniscience 事实知识测试中,其幻觉率为 15%,是所有智能指数 45 分以上模型中最低的;GPT-6 Astra 为 51%,GPT-6.1 Sol 为 54%。代价是正确率只有 50%,低于 GPT-6 Astra 的 63%——它更倾向承认不知道,而不是猜测。此外,Argon 在 AutomationBench-AA 商业软件工作流测试中以 78% 排第一,领先 Claude Sonnet 5.5 七个百分点;但在 Terminal Bench 4 编程测试中仅得 57%,落后于 Claude Sonnet 5.5、Claude Opus 5.5 和 GPT-6 Astra。它还在 Arena 文本排名中登顶,WebDev 排第八,并成为首个登顶 Vals Index 的 Gemini 模型。

为什么重要

这组数据说明 Google 在旗舰模型上重新具备与 OpenAI 正面竞争的能力,尤其选择用“更低幻觉、更愿承认不确定”作为差异化路线,对金融、医疗、法律等对事实准确性敏感的 API 场景有实际吸引力。但成本结构值得注意:Argon 每个任务约消耗 6.2 万输出 token,远高于 GPT-6 Astra 的 2.7 万,折扣期内单任务成本 1.99 美元,靠的是更低 token 单价而非更高效率。按标准价 4 美元/百万输入、20 美元/百万输出计算,单任务成本将升至约 3.98 美元,反超 GPT-6 Astra。Bloomberg 援引内部人士称,部分 Google 员工认为 Argon 存在“benchmaxxing”倾向,即追求跑分而非产品好用,前端设计能力偏弱,编程表现参差。Google 否认模型在编程等领域表现不佳。

对用户/开发者/创作者的影响

目前公开信息显示,Argon 尚未开放给普通用户和大多数开发者,付费 API 客户与 Google AI Ultra 订阅者是下一批。对开发者而言,如果幻觉率是核心考量,Argon 值得列入候选,但需注意其编程与前端能力可能不如 Claude 或 GPT 系列,且 token 消耗高意味着长任务成本更难控制。对内容创作者和企业采购来说,折扣期价格有吸引力,但 Google 未公布折扣结束时间,标准价下性价比优势会消失。建议先等 API 实际开放后,用自己的业务数据做小规模对比测试,而不是只看指数排名。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Argon 何时向付费 API 客户和 Ultra 订阅者开放,以及折扣期结束后实际定价;二是 Google 是否针对编程和前端设计短板推出后续版本或专项优化;三是 Claude Opus 5.5 与 GPT 系列在幻觉指标上是否会跟进改进,毕竟 51% 以上的幻觉率在严肃场景中仍是明显障碍。

来源:The Next Web

celebrityanime
celebrityanime
文章: 26950

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注