一句话看懂:Fireworks AI 对 DeepSeek 新发布的 DeepSeek-V4.1-Flash 做了完整评测,结果显示它在 DeepSWE 编程任务上达到 GPT-6 Astra 级别的准确率,但单任务成本只有后者的约 1/15。这意味着前沿级自动编程智能体的单位经济性正在被重写。
事件核心:发生了什么
上周,Fireworks 上线了 DeepSeek 最新模型 DeepSeek-V4.1-Flash,并对其做了覆盖编程、终端操作和多模态学术推理的基准测试。关键数据来自 DeepSWE:在 pass@1 指标上,DeepSeek-V4.1-Flash 与 GPT-6 Astra、Gemini 3.8 Flash、Claude Opus 5 同处一个精度区间,四者差距在 0.7 分以内,而测试本身的运行波动为 1.4 至 3.2 分。真正的差异出现在成本端——DeepSeek-V4.1-Flash 在 Fireworks 上每任务约 0.43 美元,分别是 Gemini 3.8 Flash 的 1/5.5、GPT-6 Astra 的 1/15、Claude Opus 5 的 1/28。在 Terminal-Bench 2.1 上,它以几乎相同的质量实现了约 12 倍的单任务成本优势;在 HLE 测试中,Fireworks 还引入了 oracle router 方法评估理论最优成本。
为什么重要
这组数据的意义不在于“又便宜了多少”,而在于它改变了自动编程智能体的可行性边界。DeepSeek-V4.1-Flash 是一个 552B 参数的 MoE 模型,采用编码器—解码器分离架构,输入侧激活 8B、输出侧激活 16B。这种非对称设计贴合编程智能体的真实负载:在 Fireworks 的 DeepSWE 运行中,输入输出 token 比例高达 174:1(3690 万输入对 21.1 万输出)。同时它在 KV Cache 上做了优化,HBM 占用降至上一代 V4 的 1/4、SSD 存储降至 1/8,使 99.6% 的输入 token 命中缓存,而缓存费用占到账单的 60%。简言之,它压的不是“算得贵不贵”,而是长循环智能体里反复重读上下文这一最大成本项。
对用户/开发者/创作者的影响
对开发者和企业团队来说,最直接的变化是:过去因为成本只能低频触发的多轮 bug 扫描、大规模测试生成、后台持续运行的编码智能体,现在可以按 15 次尝试换一次 Astra 调用的比例来设计。以 0.43 美元/任务计算,前沿级 SWE 智能体第一次接近“7×24 小时后台基础设施”的成本结构。对依赖闭源 API 的产品团队,这意味着需要在质量、延迟和 token 账单之间重新做模型路由;对创作者和轻量 AI 应用,缓存命中率带来的价格差异可能比模型跑分高低更值得看。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Fireworks 的数据是单一平台评测,其他推理服务商能否复现同样的每任务成本和缓存命中率值得验证;二是 Terminal-Bench 2.1 上 DeepSeek 输出 token 约为 Astra 的 4 倍,“想得更久”是否会在更复杂任务中带来质量反超或延迟代价;三是闭源模型厂商是否会跟进调整价格或推出更激进的缓存计费方式。


