Claude Code把系统提示砍了80%。这对小模型也适用吗?

Anthropic 最近将 Claude Code 的系统提示砍掉约 80%,而第三方实验表明,对于小型模型 DeepSeek-V4-Flash,将提示长度减半后性能几乎不变,输入 token 中位数减少 32%。这挑战了“小模型需要更详细指令”的传统直觉,提示工程可能正从“越写越长”转向“越删越精”。

一句话看懂:Anthropic 最近将 Claude Code 的系统提示砍掉约 80%,而第三方实验表明,对于小型模型 DeepSeek-V4-Flash,将提示长度减半后性能几乎不变,输入 token 中位数减少 32%。这挑战了“小模型需要更详细指令”的传统直觉,提示工程可能正从“越写越长”转向“越删越精”。

事件核心:发生了什么

Anthropic 为最新模型大幅精简了 Claude Code 的系统提示(从约 5,000 字符缩减至约 2,300 字符)。基于此思路,AI 代理工具 Ante 对其 --short-prompt 模式进行了对比实验,将完整的单次请求提示从约 34,000 字符压缩至约 18,000 字符(包括缩短的工具描述),并在 89 项任务的 terminal-bench 2.1 基准上,用小型、快速、低成本的模型 DeepSeek-V4-Flash 进行了 A/B 测试。结果显示:长提示版平均奖励为 0.573,短提示版为 0.596(+2.3 点,在单次尝试误差范围内);通过任务数分别为 51/89 和 53/89;代理错误数相同(11 次)。在 69 项结果未变的任务子集中,短提示版输入 token 中位数为 346,409,比长提示版的 509,498 降低了 32%。总运行成本从 $4.25 微降至 $4.18。

为什么重要

长期以来,行业默认小型模型由于能力弱于前沿模型,需要更详尽的手把手指令、约束和示例来避免出错。该实验首次以公开数据证明,即便在真实部署中相当常见的“小模型”上(文中称 DeepSeek-V4-Flash 距离前沿模型“几乎最远”),大幅削减提示也能维持甚至微幅提升性能,同时显著降低输入 token 消耗。这意味着过去通过堆砌指令来补偿模型弱点的做法,可能积压了大量无效甚至具有侧约束的文本——它们来自数代之前的模型故障模式,无人删除,却默默增加每次请求的计费。该结果与 Anthropic 在大模型上的结论方向一致:当新一代模型到来时,第一步不是加提示,而是删提示。

对用户/开发者/创作者的影响

对于使用 API 构建 AI 功能的开发者:应及时审查自己的系统提示和工具描述,能否在不影响任务关键上下文的前提下大幅精简。每节省 30% 的输入 token,相当于直接降低约 30% 的 API 推理成本(以 token 计价)。对于创作者和提示工程师:不再需要担心“给不够信息”而堆积长提示,代之以先跑 A/B 测试再决定保留哪些指令。需要注意的是,本实验是一次单模型、单基准、单次尝试的初步结果,±5 点的噪声区间意味着小回归仍可能被掩盖,批量任务中任务通过状态的翻转(20 项任务结果改变)也说明多轮验证的必要性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 更多模型与任务验证:目前仅测试了 DeepSeek-V4-Flash 一个模型和 terminal-bench 套件,其他小型模型(如 GPT-4o-mini、Llama 3.2 系列)是否同样适用“短提示”仍需类似实验。2. 多轮评估与默认开关:单次尝试的波动较高,若要在生产环境默认开启短提示模式,建议先进行多任务多次验证,确认不存在隐藏的能力悬崖。3. 提示工程方法论转向:若行业普遍接受“删提示”优于“加提示”,长此以往,提示库和最佳实践文档中大量历史积累的“保险条款”将被清理,提示长度有望整体下降,从而降低每笔 API 调用的成本和时间。

来源:HN Algolia · AI 24h

celebrityanime
celebrityanime
文章: 15208

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注