
一句话看懂:Google DeepMind 于 2026 年 7 月 21 日发布了三款面向 AI 代理(Agent)场景的 Gemini 系列新模型,其中 3.6 Flash 在提升编码和多模态能力的同时,输出 token 用量比上一代减少 17%,并降低了定价。同时,团队已启动 Gemini 4 的预训练工作。
事件核心:发生了什么
本次发布包含三款模型:Gemini 3.6 Flash 作为主力模型,在 DeepSWE 编码基准测试中表现从 37% 提升至 49%,在 MLE Bench 机器学习研究任务中从 49.7% 提升至 63.9%,同时输出 token 消耗减少 17%,每百万输入/输出 token 价格分别为 1.5 美元和 7.5 美元,低于 3.5 Flash。计算机操作(Computer Use)功能已作为客户端工具内置于 Gemini API 和 Gemini Enterprise 中。
3.5 Flash-Lite 是当前最快的轻量级模型,输出速度达每秒 350 token,针对高吞吐量及低延迟的代理工作流优化。
3.5 Flash Cyber in CodeMender 则是一款专攻网络安全的专用模型,配合 CodeMender 代码安全代理运行,旨在提升自动化安全审计的竞争力。
此外,Gemini 3.5 Pro 正在与合作伙伴测试中,而 Gemini 4 的下一代预训练也已启动。
为什么重要
这三款模型直接回应了开发者社区对 AI 代理(Agent)系统“更高 token 效率、更低延迟、更可靠性能”的核心诉求。3.6 Flash 在保持或提升质量的前提下降低 token 用量与价格,意味着构建和运行多步骤代理任务的边际成本显著降低,可能加速大模型从对话助手向自动化工作流的部署。Gemini 4 的预训练启动也表明 Google 正试图在模型性能与效率之间持续寻找平衡点,以应对来自 OpenAI、Anthropic 等竞争对手的生态挤压。专用安全模型 3.5 Flash Cyber 的出现,则说明大模型厂商正在针对垂直行业(如网络安全)推出专精版本,以降低通用模型的安全风险并提高领域适配性。
对用户/开发者/创作者的影响
对于 AI 应用开发者,3.6 Flash 的更低 token 消耗和定价可直接降低 API 调用成本,尤其适合需要多次推理和工具调用的 agent 场景,如代码迁移、竞品分析、金融数据处理等。3.5 Flash-Lite 适合需要高并发和实时响应的场景,如聊天机器人、轻量内容审核等。创作者可以利用 3.6 Flash 增强的计算机视觉和图像理解能力,进行 3D 工作流中的纹理提取或与离线绘图工具结合构建互动工具。推荐阅读 DeepMind 的 3.6 Flash 模型卡片以了解安全限制与合规信息。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,3.6 Flash 的定价是否会导致其他厂商调整 Flash 级模型的 API 价格;第二,Gemini 3.5 Pro 何时正式公测,以及其推理能力是否能达到前沿水平;第三,专业安全模型 3.5 Flash Cyber 是否会开放为企业定制版本,并影响现有安全工具的市场布局;第四,Gemini 4 的预训练方向是否包含更高效的稀疏架构或推理优化。


