
一句话看懂:Google 在2026年7月22日发布三款新模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。官方定位是更快、更省 token,但网友实测后反馈:虽然确实省了成本,但模型能力(尤其在推理与任务执行上)出现了“降智”现象,引发广泛调侃。
事件核心:发生了什么
Google 此次推出的三款模型分别针对不同场景。旗舰款 Gemini 3.6 Flash 是 5 月 I/O 大会上 3.5 Flash 的小版本升级,主打 token 节省:根据 Artificial Analysis Index 数据,其输出 token 比 3.5 Flash 减少 17%,在 DeepSWE 场景下最高节省 65%,价格也降至输出每百万 token 7.5 美元(原 9 美元)。官方公布的多项基准成绩有所提升,例如 DeepSWE 从 37% 升至 49%、MLE Bench 从 49.7% 升至 63.9%,知识截止日期从 2025 年 1 月更新到 2026 年 3 月。第二款 3.5 Flash-Lite 定位极致速度与性价比,每百万 token 输入仅 0.3 美元、输出 2.5 美元,每秒可生成 350 token,在 SWE-Bench Pro(54.2% 对 49.6%)和 OSWorld-Verified(74% 对 65.1%)等多项 agent 任务上甚至反超了更高级的 3Flash。第三款 3.5 Flash Cyber 专攻代码安全漏洞修复,基于 3.5 Flash 微调并配合 CodeMender 工具,已在 CyberGym 基准上达到第一梯队水平。
为什么重要
这次发布反映了 Google 在模型策略上的明确转向:不再一味追求“更强”,而是将“更便宜、更快、更省 token”作为优先卖点。这顺应了大模型商用化进入“性价比比拼”阶段的趋势——企业采购更看重单次推理成本与 token 开销。但同时,网友的负面评价(如“省了 token 丢了智商”)也敲响警钟:若 token 压缩和推理步数减少导致实际任务成功率或用户体验下降,那么价格的下降可能无法挽回人心。此外,较低端的 Flash-Lite 在部分 agent 任务上跑赢更高阶的 3Flash,说明 Google 内部不同模型之间的定位出现了重叠甚至错位,开发者需要更精细地按任务选择合适的模型。
对用户/开发者/创作者的影响
对于开发者,如果追求 API 调用成本最小化,3.6 Flash 确实是现阶段更省 token 的选择,适合高并发、大规模 agent 任务。但需要在实际项目中测试其推理质量是否满足需求,如代码生成、多步任务规划等场景。3.5 Flash-Lite 性价比极高,适合文档处理、批量翻译、快速摘要等低复杂性任务,但官方建议可根据推理任务难度手动调节“思考级别”,灵活控制成本与效果。对于安全从业者,3.5 Flash Cyber 提供了一个开箱即用的批量代码修复工具,适用企业安全运维。对于普通创作者,模型价格下降不会直接影响使用体验,但若模型在复杂创作(如长文生成、多轮对话)中表现不如预期,可能会让部分用户选择回退到旧版或竞品。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,模型的实际能力下降是否只发生在特定数据集或任务类型上,还是普遍现象,需要第三方独立评测机构尽快发布对照结果。第二,Google 是否会在后续补丁或微调版本中修复用户反感的“降智”问题,或者干脆放弃 token 节省策略,回归到能力优先路线。第三,竞品(如 OpenAI、Anthropic)是否会跟进 token 节省路线,还是持续增强模型能力以拉开差距。第四,3.5 Flash-Lite 超越 3Flash 的现象是否意味着 Google 将更新其模型层级体系,或在定价策略上进行更大调整。
来源:AIbase


