一句话看懂:Anthropic 的 Claude 模型已支持“降低推理 effort 时不破坏 prompt cache”的新机制,但该功能目前只在 API 上线,尚未同步到 Claude Code 客户端。官方预计一两天内补发,这直接影响开发者调用成本和缓存命中效率。
事件核心:发生了什么
Anthropic 相关人员 Thariq 于 2026 年 9 月 3 日在 X 平台发文说明,关于模型在降低“effort levels”(推理努力程度)时不会清除 prompt cache(提示词缓存)的更新,目前仅部署在 API 端,尚未包含在 Claude Code 产品中。官方表示该功能本应随模型发布一同推出,但因相关责任人休假(OOO)未能及时上线,预计将在一天左右完成同步,并会在准备就绪后发布确认说明。这条推文获得了近 3 万次浏览,主要引发了大模型 API 开发者和 Claude Code 深度用户的关注。
为什么重要
对于调用大模型 API 的团队而言,prompt cache 是降低推理成本、减少延迟的关键机制。通常,开发者在调整模型推理的 effort 参数时,系统可能会重新计算上下文,导致缓存失效并产生更高的 token 费用。Anthropic 推动“调整 effort 不破坏缓存”的能力,意味着开发者可以在“更省算力”与“保持快速响应”之间灵活切换,而不必为参数调整额外买单。这一技术细节虽小,却直接关系到 Claude API 在复杂 Agent 任务、长对话和代码生成场景中的经济性。与此同时,Claude Code 作为面向程序员的主流编码助手,尚未获得该项优化,也说明官方在新模型能力向终端产品传导的节奏上存在时间差。
对用户/开发者/创作者的影响
对使用 Claude API 的开发者来说,该功能落地可减少缓存未命中带来的额外推理开销,尤其适合高频调整模型“认真程度”的自动化工作流——比如内容批量审核、代码重构或多轮工具调用。对 Claude Code 用户来说,目前仍需等待客户端更新,短期内可能出现 API 与终端产品体验不一致:API 调用方已经能享受缓存收益,而通过 Claude Code 间接调用模型的用户则暂时无法感知变化。对于甲方或技术决策者,建议在评估 Claude 系列模型的单位成本时,将“effort 调整是否保留缓存”作为一项新的比对指标,因为它会直接影响长上下文任务的实际账单金额。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
可以关注三个具体信号:其一,Claude Code 是否在未来两天内完成该能力对齐,并在 changelog 中明确标注开发工具版本号;其二,Anthropic 是否会通过定价页面或文档更新,说明“effort 参数 + prompt cache”组合的计费规则是否发生调整;其三,竞品(如 OpenAI 的 API 或 Google Gemini)是否会在推理预算控制功能上跟进类似设计,避免在开发者生态的成本竞争中掉队。


