OpenAI 为 GPT-6 推出改进的提示词缓存系统与诊断工具

OpenAI 为 GPT-6 推出改进的提示词缓存系统和配套诊断工具,通过提高缓存命中率、提供可视化监控面板和显式缓存控制,让长时间运行的 AI 智能体响应更快、成本更低。

一句话看懂:OpenAI 为 GPT-6 推出改进的提示词缓存系统和配套诊断工具,通过提高缓存命中率、提供可视化监控面板和显式缓存控制,让长时间运行的 AI 智能体响应更快、成本更低。

事件核心:发生了什么

2026 年 9 月 22 日,OpenAI 发布针对 GPT-6 系列模型的改进版提示词缓存系统。核心变化包括:默认缓存命中率提升,符合条件的共享前缀在 30 分钟窗口内复用可获得缓存折扣,缓存输入 token 折扣最高仍维持 90%。

OpenAI 同时推出三款新工具:Prompt Caching Dashboard 用于追踪缓存命中率并对比缓存与未缓存 token 的输入构成;prompt caching diagnostics 诊断工具用于分析缓存未命中的原因,例如工具定义变更、模型或设置变化,并估算受影响 token 数量;显式缓存断点让开发者自行选择哪些提示词前缀需要复用。

针对智能体开发场景,GPT-6 支持在响应之间调整 reasoning effort 而不破坏缓存,并建议开发者通过 allowed_tools 和 tool_choice 参数保持工具定义稳定,避免因删除定义导致缓存失效。此外,预热缓存功能可在用户发起请求前提前处理已知上下文,减少等待时间。GitHub Copilot 方面表示,过去几个月其需重新处理的提示词 token 占比已减少超过 50%。

为什么重要

提示词缓存直接关系到 AI 智能体的经济性。像代码重构、深度研究和演示文稿生成这类任务,往往需要数小时的连续 API 调用,大量重复携带相同的指令、工具定义和上下文。缓存命中率每提高一点,都意味着推理成本和首字延迟的下降。

这次更新把缓存从一个“自动生效但不可见”的机制,变成可观测、可干预的基础设施。仪表盘和诊断工具让开发者能定位缓存失效的具体原因,而不是盲猜。显式断点和预热缓存则把控制权交还给应用层。对 OpenAI 而言,这是在智能体赛道竞争加剧的背景下,用推理效率巩固开发者生态的一步。

对用户/开发者/创作者的影响

对开发者,最直接的价值是成本可预期性提升。此前缓存失效常常无声发生,诊断工具能直接返回如 tools_changed 的具体原因和受影响 token 数量,便于快速修复。显式断点让开发者可以主动规划哪些内容稳定缓存、哪些内容放在提示词末尾频繁变化。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对构建长时间运行智能体的团队,reasoning effort 可动态调整而不破坏缓存,意味着可以在同一会话中为困难任务提高推理投入、为常规跟进降低开销,同时保留可复用上下文。预热缓存则适合在应用启动阶段提前准备共享指令和参考材料,把处理时间移出用户等待窗口。

对普通用户,这些改进不会直接可见,但会体现为智能体应用响应更快、长任务中断更少,以及开发者因成本下降而更愿意开放长上下文功能。目前公开信息显示,缓存折扣和工具面向 API 开发者,具体定价页面是否需要同步更新,尚待进一步确认。

值得关注的后续

一是缓存命中率提升的实际幅度,OpenAI 未给出具体数字,GitHub Copilot 的 50% 减少是单一合作方数据,更多第三方基准值得观察。二是诊断工具和仪表盘是否会在其他模型系列上线,还是仅限 GPT-6 家族。三是 Anthropic、Google 等竞品是否跟进类似的缓存可视化和显式控制能力,这将影响智能体开发者的平台选择。

来源:OpenAI News

celebrityanime
celebrityanime
文章: 25067

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注