
一句话看懂:Google 于2026年7月21日发布三款新模型,核心目标是让构建和运行 AI Agent 更便宜、更快、更可靠。3.6 Flash 在提升编码和多模态表现的同时,将输出 token 消耗降低 17%;3.5 Flash-Lite 主打速度;3.5 Flash Cyber 则瞄准网络安全 Agent 场景。
事件核心:发生了什么
Google 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中,3.6 Flash 是主力更新,据 Artificial Analysis Index 数据,其输出 token 消耗比 3.5 Flash 减少 17%,在 DeepSWE 等基准测试中部分任务可节省高达 65% 的 token 成本,且定价更低:每百万输入 token 1.5 美元,每百万输出 token 7.5 美元。3.5 Flash-Lite 则是目前最快的 3.5 系列模型,每秒可输出 350 个 token,性价比优于此前版本。3.5 Flash Cyber 是一款专门针对网络安全优化的模型,结合 Google 的 CodeMender 代码安全 Agent 提供服务。此外,Google 透露 Gemini 3.5 Pro 正在与合作伙伴测试,Gemini 4 的预训练也已经启动。
为什么重要
这一发布标志着 Google 在 Agent 推理效率上的关键突破。以往开发者在构建多步骤 Agent 时,最大的瓶颈是 token 消耗和推理延迟——模型会生成大量冗余输出,导致成本失控。3.6 Flash 通过减少不必要的回答和工具调用步骤,直接降低了每次 Agent 任务的实际开销。这与 OpenAI 近期发布的一系列高性价比模型形成直接竞争。同时,3.5 Flash Cyber 的出现说明大模型正在从通用能力向垂直安全场景下沉,Agent 不再是单一对话模型,而是模型+基础设施的组合产品。
对用户/开发者/创作者的影响
对于使用 Gemini API 的开发者,3.6 Flash 更低的输出 token 成本和更高的精度意味着能够构建更多的自动化流程,比如代码迁移、数据分析、金融文档解析等。3.5 Flash-Lite 适合对延迟敏感的高并发场景,例如实时用户交互。企业客户在采购 Agent 解决方案时,现在可以更清晰地根据 token 消耗和速度来做成本核算。3.5 Flash Cyber 加上 CodeMender 的组合,则让网络安全团队能直接使用 AI 辅助代码安全审计,降低了从前需要自建 Agent 框架的门槛。普通用户暂时看不到直接变化,但底层效率提升将间接改善 Google 产品的响应速度和质量。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先,3.6 Flash 能否在长期实际 Agent 工作流中保持其声称的 17%-65% 的 token 节省,还是只对特定基准测试有效,值得开发者验证。其次,3.5 Pro 何时结束测试并全面开放,以及其定价策略如何,将直接影响 Google 在高端 Agent 市场的竞争力。第三,Gemini 4 的预训练已经启动,但距离发布还有相当长时间,目前来看 3.6 系列可能是未来半年到一年内 Google 的主力交付模型,其开发者生态的扩张速度是关键观察点。


