
一句话看懂:OpenRouter 发布了 Prompt Caching(提示缓存)和 Sticky Routing(粘性路由)两项技术,通过复用多轮对话中的重复内容,大幅降低开发者构建 AI Agent 时的 token 费用,让长期交互成本最高降至原来的 0.175 倍。
事件核心:发生了什么
7月22日,OpenRouter 宣布上线两项新技术。在多轮 Agent 对话中,系统提示、工具定义和策略指令经常被反复发送,造成大量不必要的计费。Prompt Caching 允许系统从缓存中读取这些重复内容,以极低成本替代全额输入。以 Claude Sonnet 4.6 为例,正常输入的 token 价格为每百万个 3 美元,缓存读取仅需 0.30 美元,成本降至 10%。不同服务商的缓存读取费用为正常价格的 0.1 至 0.5 倍,最高可将成本压缩至原来的 1.75 倍。同时,Sticky Routing 机制确保后续请求自动发送到持有热缓存的同一家服务商,维持缓存持续命中。
为什么重要
长期以来,多轮 Agent 调用中昂贵的“重复计费”是影响开发者部署长期交互应用的主要障碍。OpenRouter 的这一组合方案直接降低了长期运行 Agent 的推理成本,为复杂任务编排和持续性对话提供了可行的经济基础。它让 AI Agent 在客服、自动化工作流等场景中的商业化更有吸引力,也为其他 API 平台定义了降本模板。目前,开发者需设置 session_id 即可在第一次成功请求后立即启用 Sticky Routing,使用体验门槛较低。
对用户/开发者/创作者的影响
对于使用 OpenAI、Anthropic 等模型构建对话式应用的开发者,需要调整代码以传递 session_id,并检查响应中的 usage 数据确认缓存是否生效。对于创作型用户,若使用 Agent 工具进行长文写作、多轮分析或迭代修改,底层成本将下降,可能促使更多免费或低价层被推出。对于企业采购方,在评估 Agent 平台的定价时,应关注其是否支持类似缓存机制,以更精确估算长期运营的 API 支出。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Prompt Caching 在多轮会话中的实际命中率是否稳定,结果将直接影响开发者的采用意愿。第二,Anthropic、OpenAI 等模型提供商是否会推出官方对标的缓存接口,或对 OpenRouter 的缓存读取定价做出反应。第三,该技术对 Agent 框架(如 LangChain、AutoGPT)的适应性和兼容性是否会迅速更新,将决定生态扩展速度。
来源:AIbase
![[Question]: How to improve image PDF parsing quality?](https://www.chat-gpts.plus/wp-content/uploads/2026/07/8762-c968787d-768x403.jpg)
![[Question]: Letter 'n' missing when parsing documents](https://www.chat-gpts.plus/wp-content/uploads/2026/07/8724-b12951ff-768x403.jpg)
![[Question] BE can't connect to minio when changing port](https://www.chat-gpts.plus/wp-content/uploads/2026/07/8821-07f7de62-768x403.jpg)