
一句话看懂:Google 在最新发布的 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 模型中,正式弃用了传统的 temperature、top_p 和 top_k 参数,转而采用新的“思考”(thinking)机制来控制模型输出。此举标志着生成式 AI 的采样控制从黑科技参数转向更直观的推理过程管理。
事件核心:发生了什么
Google 于近日更新了 Gemini API 文档,确认其最新的 Gemini 3.6 Flash(模型 ID:gemini-3.6-flash)和 Gemini 3.5 Flash-Lite(模型 ID:gemini-3.5-flash-lite)两款模型已正式投入生产(GA 状态)。在这两个新模型中,开发者过去所依赖的 temperature、top_p 和 top_k 参数已被“弃用并被忽略”。取而代之的是全新的“思考等级”(thinking level)设定,默认为“medium”(中等)或“minimal”(最小),用以控制模型推理的深度和风格。同时,Google 主推新的交互 API(Interactions API)作为访问这些新功能的推荐通道。定价方面,Gemini 3.6 Flash 的输入输出价格分别为 $1.50/100万 tokens 和 $7.50/100万 tokens,较前代 3.5 Flash 的 $9.00/100万输出 tokens 有所下降。两款模型均支持 100万 tokens 上下文窗口、64k 最大输出 tokens 以及内置的计算机使用工具(Computer Use)。
为什么重要
传统上,大模型的输出随机性由 temperature、top_p 和 top_k 三个参数共同控制,开发者需要反复调参以平衡创造性与确定性。Google 此次弃用这套体系,转而使用“思考等级”系统,反映了业界对模型行为的控制正在从“统计采样”向“显式推理”迁移。这简化了 API 的调用复杂度,降低了新手开发者的使用门槛,但同时也意味着旧有的调参经验和工具链可能面临失效。此举进一步拉开了 Google 与 OpenAI、Anthropic 在模型接口设计上的差异,使得 Gemini 的开发者生态更加独立,并可能推动整个行业重新定义“可控生成”的标准接口。
对用户/开发者/创作者的影响
对于开发者:需要立即检查并修改代码,移除所有对 temperature、top_p 和 top_k 的调用,转向使用 thinking_config 设置。建议从 medium 级别开始测试,根据任务需求在 minimal(高速执行)与 high(复杂规划)之间切换。目前 Google 推荐使用新的交互 API(Interactions API)以获得最佳兼容性。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于 AI 应用集成商:新模型在复杂智能体任务和多模态任务上表现更强,尤其是 Gemini 3.6 Flash 在减少推理步骤和循环迭代方面有显著改进,更适合构建自动化工作流。但需注意,Google 承认新模型在 UI 视觉布局方面不如前代,如开发前端应用,需额外提供详细设计指南。
对于内容创作者:新模型输出更稳定,代码生成质量更高,但随机创造力的控制方式发生了变化。建议在需要创意发散的任务中,尝试降低思考等级或结合特定的提示语策略。
值得关注的后续
1. 竞品跟进:OpenAI 和 Anthropic 是否会模仿 Google 的做法,逐步废弃 temperature 等参数并推广“思考等级”系统?这将是 API 设计标准的风向标。
2. 开发者生态反应:现有的许多开源工具和第三方库(如 LangChain、LlamaIndex)高度依赖 temperature 等参数。它们将如何适配 Google 的新 API 范式?不兼容可能导致一部分开发者暂缓迁移。
3. 性能验证:目前公开信息显示,Gemini 3.6 Flash 的输出价格虽较前代降低,但其在“Humanity’s Last Exam”等复杂推理基准上的具体表现尚未完全公开(3.5 Flash-Lite 的 HLE 得分仅为 18.0%)。后续独立评测将验证其实际能力是否匹配定价。


