一句话看懂:谷歌 2026 年 9 月 30 日发布 Gemini 4 Argon,单次输出上限拉到 100 万 Token、首发 API 价格约为 GPT-6 Astra 的六成,但受控早期访问尚未向普通开发者开放,终端与长程工程基准反而落后 Astra 约 10.5 个百分点,因此不建议现在迁移编程工作流。
事件核心:发生了什么
谷歌发布新一代模型 Gemini 4 Argon。据官方信息,其单次输出 Token 上限从上一代的 6.4 万提升到 100 万,而 GPT-6 Astra 目前单次输出上限约为 12.8 万。官方公布的 18 项评测中 Argon 拿下 12 项领先、1 项并列第一,DeepSWE v1.1 得分 77.9%(Astra 74.1%),CWE-bench v1 漏洞修复以 68% 并列首位。价格方面,Argon 首发为每百万输入 Token 2 美元、输出 10 美元,缓存输入享 95% 折扣;据 Artificial Analysis 测算,促销期每任务平均成本约 1.99 美元,比 Astra 低约 40%,但促销结束后标准价将升至输入 4 美元、输出 20 美元,成本反而约为 Astra 的 1.2 倍。
为什么重要
这轮发布把竞争焦点重新推回“超长输出”与 API 定价:百万 Token 输出理论上支持一次生成整块子模块或超长审计日志,对 Agent 编排和批处理场景有吸引力。但基准领先并不等于工程可用。目前公开信息显示,在更接近真实长程工程的 FrontierSWE v2 上 Argon 落后 Astra 10.5 个百分点,Terminal-Bench Science 0.1 同样落后 10.5 个百分点,纯终端交互的 Terminal-Bench 4.0 落后 Claude Opus 5.5 达 9 个百分点。据彭博社 2026 年 9 月 30 日报道,谷歌内部对 Argon 在编码等关键任务中的稳定性也存在疑虑。终端执行精度差 10%,意味着依赖自动装依赖、跑容器、读报错、回滚代码的链路更容易卡壳。
对用户/开发者/创作者的影响
最现实的门槛是可用性:Argon 目前走受控早期访问(Fairwind Program),首批仅面向受信任的网络安全防御机构,企业通用通道和独立开发者账户尚未放行;而 GPT-6 Astra 已于 2026 年 9 月 3 日向 ChatGPT 与 API 客户全量开放。对一人公司和中小团队来说,现在谈迁移基座没有生产力价值。选型上,复杂工程调度和终端 Agent 可继续用 Astra 与 Claude 体系;日常补全沿用成熟生态;对 Argon 等公开 API、且有第三方生产环境评测后再灰度测试。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Fairwind 计划何时向普通开发者开放 API;二是促销期结束后实际账单是否如测算般反转;三是终端类基准能否通过版本迭代补齐,若终端鲁棒性长期落后,AutoGPT 式全自动链路仍难落地。
来源:juejin


