一句话看懂:Anthropic 官方发布了一篇关于 Claude Code 的实操指南,核心是在 token 计费模式下减少无效上下文、利用 prompt 缓存机制,让每次会话花更少的钱完成同样的编码任务。这标志着 AI 编程工具已从“能不能用”进入“怎么用得省”的阶段。
事件核心:发生了什么
2026 年 8 月 14 日,Anthropic 开发者关系工程师 Lydia Hallie 在官方博客发表了《最大化 Claude Code 会话价值》,系统拆解了 agentic 编码工具的成本构成。文章指出,Claude Code 的每次请求都涉及两阶段计费:prefill 阶段处理输入 token,decode 阶段逐 token 生成输出,后者单价约为前者的 5 倍。实际消耗还取决于所选模型大小、effort 思考强度以及 hit 或 miss prompt cache 的差异。文章给出六条具体建议:任务间运行 /clear;会话开始前通过 /model 和 /effort 固定配置;用 @-mention 直接引用文件;给命令加 quiet 参数或交给 subagent 执行;新会话先跑 /context 检查加载内容;离开键盘前先 /compact,因为缓存约一小时后过期。
为什么重要
这是模型厂商首次以官方指南形式,针对单次会话 token 成本给出系统性优化方法论。其背景是 AI 编程工具的商业化正在从订阅制、固定费用转向按量计费,token 用量直接决定单个任务的实际成本。过去开发者关注的是大模型能否写出正确代码,现在需要同样关注“写出这段代码花了多少 token”。Anthropic 选择公开这些技巧,一方面是为了缓解用户对 Claude Code 成本失控的抱怨,另一方面也是在确立自身生态的使用规范——引导开发者在同一模型、同一缓存体系内优化效率,而不是转向其他更便宜的编程工具。
对用户/开发者/创作者的影响
对日常使用 Claude Code 的开发者,这套建议等同于一套可直接执行的省钱清单:在多任务会话中及时 /clear 能避免无关上下文持续占用输入窗口;将模型和 effort 级别在会话开始前定好,可防止中途切换导致 prompt cache 全部失效;用 @-mention 引用文件可省掉一次工具读取调用;把高频噪音命令放入子代理运行,则避免大段输出被永久留在对话记录里。对企业团队而言,这意味着可以建立内部编码成本规范,比如要求成员在长时间任务中途执行 /compact 压减上下文,或者对简单重构任务强制使用 effort low 和更小的模型。对于使用其他 API 模型的创作者,这篇文章同样揭示了推理成本运营的关键原则:管理上下文窗口内容、识别缓存有效期、区分输入与输出 token 价格。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,这套优化技巧仍以用户侧手动操作为主。后续值得观察的有三个点:其一,Anthropic 是否会将 /context 审查和自动 compact 做成默认行为,从而降低对用户操作习惯的依赖;其二,prompt cache 的时长和定价模式是否会调整,因为它是影响整体成本的关键变量;其三,Cursor、GitHub Copilot 等竞品是否会跟进类似的成本指导文档,推动 AI 编程工具全面进入“每 token 都需计算价值”的竞争阶段。


