人工智能竞赛突然变得尴尬了

中国实验室公开的 KV cache 优化方案,正被西方厂商快速采用——Claude Opus 5.5、GPT-6.1 Sol 的缓存读取价格随之大幅下调,而双方对这次“借鉴”都选择了低调处理。

一句话看懂:中国实验室公开的 KV cache 优化方案,正被西方厂商快速采用——Claude Opus 5.5、GPT-6.1 Sol 的缓存读取价格随之大幅下调,而双方对这次“借鉴”都选择了低调处理。

事件核心:发生了什么

据 insufferable.dev 报道,DeepSeek 在 KV cache(键值缓存)优化上取得突破:从此前把缓存压缩约 15 倍的 MLA 架构,演进到 Compressed Sparse Attention、Heavily Compressed Attention,最新的 DeepSeek-V4.1-Flash 进一步引入 CSA2、跨层缓存复用、因果编码器-解码器架构和 FP4 缓存,使全局 KV cache 降到每 token 890 字节;在编程等长会话场景下,缓存占用相比 DeepSeek-V1 最高降低约 437 倍。这些方案被公开分享后,很快出现在西方厂商的新模型中。Anthropic 的 Claude Opus 5.5 把缓存读取价格较 Opus 5 下调 60%,OpenAI 的 GPT-6.1 Sol 较 GPT-5.6 Sol 七月末的价格下调 80%,两款模型发布都相对安静,没有大规模预热。

为什么重要

长上下文模型推理的最大成本之一,是 GPU 显存要装下 KV cache。缓存占用下降直接压缩了推理成本,也提高了单卡可服务的并发量。中国实验室因先进 GPU 获取受限,长期把性能优化放在优先级最高的位置,这轮成果因此颇具实用价值。过去“中国模型蒸馏西方模型”的叙事占据头条,Anthropic 也多次公开强调这一点;现在方向出现反转,西方厂商开始吸收中国实验室的公开技术。原文对此措辞是“采用(adoption)”,而非带有指责意味的“窃取”。目前公开信息显示,这种反向技术流动可能会削弱西方厂商此前围绕“被蒸馏”构建的监管叙事。

对用户/开发者/创作者的影响

最直接的变化是 API 成本。缓存读取是长对话、代码补全、文档问答等 AI 应用的主要计费项之一,60% 到 80% 的降幅会实打实压低调用账单,让开发者更容易把长上下文能力放进生产环境。企业采购在评估大模型时,也可以把缓存单价和长会话稳定性纳入比较维度。创作者若使用带长记忆的写作或编程工具,短期内未必看到界面变化,但工具背后的成本结构已经松动。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是缓存优化是否会成为各家推理服务的标配,后续模型价格是否继续下探;二是西方厂商会不会在技术文档中明确标注相关优化的来源;三是如果监管讨论仍建立在“中国蒸馏西方”的框架上,这套论据与实际技术流动方向之间的落差,可能成为新的争论点。

来源:insufferable.dev

celebrityanime
celebrityanime
文章: 26540

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注