一句话看懂:谷歌发布 Gemini 4 Argon,在 Artificial Analysis 智能指数上以 53 分追平 GPT-6 Astra,并以折扣价实现约 60% 的单任务成本,谷歌重新进入智能前三实验室。
事件核心:发生了什么
2026 年 9 月 30 日,Artificial Analysis 发布了对谷歌 DeepMind 新模型 Gemini 4 Argon 的评测。这是谷歌七个多月来首个高于 Flash 级别的专有模型。在高推理模式下,它在 Artificial Analysis Intelligence Index 上得分 53,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分,比谷歌此前的 Gemini 3.1 Pro Preview(30)高出 23 分。
定价方面,标准价为每百万输入/输出 token 4 美元/20 美元,目前促销五折为 2 美元/10 美元,缓存输入折扣提升至 95%。折扣价下,每个智能指数任务成本为 1.99 美元,约为 GPT-6 Astra(max)的 60%,但促销结束后将升至 3.98 美元。模型支持 1M token 上下文窗口,可处理文本、图像、视频和语音输入,输出为文本。
为什么重要
过去一年,谷歌在非 Flash 旗舰模型上表现平淡,Gemini 3.1 Pro Preview 智能指数仅 30 分,被 OpenAI 和 Anthropic 拉开差距。Gemini 4 Argon 将谷歌重新带回智能前三,与 OpenAI、Anthropic 形成更直接的竞争。更关键的是,其成本效率来自更低的 token 单价,而非减少 token 使用量——它平均每任务输出 62k token,远高于 GPT-6 Astra 的 27k,说明谷歌在推理性价比上采取了不同策略。
另一个值得注意的指标是幻觉率。在 AA-Omniscience 测试中,Gemini 4 Argon 幻觉率仅 15%,是所有智能指数 45 分以上模型中最低的,远低于 GPT-6 Astra 的 51% 和 GPT-6.1 Sol 的 54%。这意味着它更倾向于承认不确定,而不是编造答案,对需要可靠性的企业场景有实际价值。
对用户/开发者/创作者的影响
对开发者而言,Gemini 4 Argon 的 API 定价在促销期内具有竞争力,尤其是缓存输入 95% 折扣,适合高频调用、长上下文或代理工作流场景。它在 AutomationBench-AA 上以 78% 排名第一,Terminal Bench 4 达到 57%,较 Gemini 3.1 Pro Preview 提升 53 个百分点,代理能力明显补强。不过,目前模型仅面向选定用户推出,尚未公开可用,普通开发者还无法直接调用。对内容创作者和企业采购来说,低幻觉率意味着在事实核查、客服、文档处理等任务中可能减少人工复核成本,但准确率(50%)仍低于 GPT-6 Astra(63%),需要结合具体任务评估。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,五折促销结束后,单任务成本将升至约 3.98 美元,届时性价比是否仍具优势需要重新评估。第二,谷歌尚未确认公开可用时间,模型能否从限量测试走向广泛 API 开放,将决定其实际影响力。第三,竞品是否跟进降价或推出新模型,以及 Gemini 4 Argon 在更多真实场景中的代理表现是否稳定,值得持续观察。


