控制LLMs的推理努力

OpenAI 在最近推出的 GPT-5.6 模型系列中,提供了细粒度的“推理努力”设置,让用户可以在低、中、高三种推理强度之间选择。这不是一个修修补补的小功能,而是“推理模型”从学术实验走向产品化、可配置化的关键一步。

控制LLMs的推理努力

一句话看懂:OpenAI 在最近推出的 GPT-5.6 模型系列中,提供了细粒度的“推理努力”设置,让用户可以在低、中、高三种推理强度之间选择。这不是一个修修补补的小功能,而是“推理模型”从学术实验走向产品化、可配置化的关键一步。

事件核心:发生了什么

根据 Sebastian Raschka 的专题分析,OpenAI 于上周发布的 GPT-5.6 系列模型(含 Sol 等子型号)支持约 5-6 档不同的“推理努力”设置。这些设置实际上控制模型在执行任务前投入多少计算资源用于“中间推理轨迹”(即模型自问自答、自我纠错的过程)。简单说,用户可以让模型“少思考一点快速输出”或“多思考几步再给出答案”。这种设计建立在 2024 年 OpenAI o1 模型开创的推理模型范式和 DeepSeek-R1 提出的可验证奖励强化学习(RLVR)训练方法之上。RLVR 通过奖励模型在数学、代码等可验证领域的最终答案是否正确,而忽略中间的推理轨迹,使模型在没有人工标注推理过程的情况下自学“顿悟时刻”(Aha moments)和回溯修正能力。

为什么重要

推理模型的“可调努力”对 AI 行业有双重意义:第一,它意味着“推理智能”不再是二元的(推理或非推理),而变成了一个可量化的资源控制维度。这在模型推理成本优化上有直接价值——简单问题用低努力模式可节省 70% 以上的 token 消耗,复杂问题再用高努力模式保精度。第二,它将 OpenAI、DeepSeek 等头部公司的技术从“论文演示”阶段推向了“产品接口”阶段。GPT-5.6 的多档位设置证明,训练和推理两端的 scaling(缩放)已成为可组合的参数,而不是孤立的机制。这对后续竞品(如 Anthropic、Google)的模型设计思路将产生直接影响。

对用户/开发者/创作者的影响

  • API 开发者:在 GPT-5.6 的 API 中,你可以按任务类型(如简单问答、代码调试、数学证明)选择不同的努力档位,从而精确控制推理延迟和预算。这对于需要高吞吐量的生产系统尤其关键。
  • 普通用户:在 ChatGPT 客户端中,用户可能无法直接看到努力设置界面,但 OpenAI 可能会根据问题复杂度自动选择合适的档位,或提供“快速/深度”显式选项。这会直接影响回答质量和响应速度。
  • 内容创作者与研究者:对需要验证推理链的复杂任务(如论文分析、多步骤论证),使用高努力模式可以显著减少错误率,但也需要注意 token 成本的增加。

值得关注的后续

目前公开信息显示,GPT-5.6 的 Ultra 档位基准测试结果尚未公布,但其 Sol 和 Max 档位数据已表明努力程度与评分正相关。值得观察以下几点:第一,OpenAI 是否会为不同努力档位设置独立的定价阶梯,以促使开发者“精准调用”;第二,DeepSeek、Qwen 等开源模型是否会跟进,在推理阶段提供类似的可配置努力机制;第三,这种“可调推理”的设计是否会导致模型在低努力模式下变得更加“偷懒”或产生更多错误,还是能在轻量级推理时保持基础安全性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 14778

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注