DeepSeek 推出的模型反超 Fable 5…? 中國大語言模型商持續顛覆戰局,DeepSeek 2.0 時刻還得是主角來推出重磅模型 DeepSeek 2 天前推出的新模型4-Flash 於 Terminal Bench 2.1 的分數達到了82.7,相較於4月的分數 56.9 達成了大躍進 ⚡️ 至於他們的模型到底有多便宜? 跟 Fable 5 可以差到近 180 倍 和 GPT 5.6 Sol 也可以差到 100 倍… 準備…

DeepSeek 约两天前通过 API 静默上线了新模型 V4-Flash,在 Terminal-Bench 2.1 上拿下 82.7 分,比 4 月预览版大幅提升 25.8 分;并且按 API 定价估算,其调用成本仅为头部闭源模型的百分之一量级,值得开发者重新评估模型选型。

一句话看懂:DeepSeek 约两天前通过 API 静默上线了新模型 V4-Flash,在 Terminal-Bench 2.1 上拿下 82.7 分,比 4 月预览版大幅提升 25.8 分;并且按 API 定价估算,其调用成本仅为头部闭源模型的百分之一量级,值得开发者重新评估模型选型。

事件核心:发生了什么

据 X 用户 @Alvin0617 汇总,DeepSeek 于 8 月 2 日前后通过官方 API 渠道更新了 V4-Flash 模型。该模型在 Terminal-Bench 2.1 基准测试中的得分为 82.7,而 4 月首次预览时仅为 56.9,提升幅度超过 25 分。Terminal-Bench 2.1 衡量的是 AI 代理在真实终端命令行环境中执行复杂任务的完成率,得分越高代表模型的工具调用、代码生成和任务拆解能力越强。

目前该模型仅开放 API 使用,open weights 开源权重版本尚未发布。价格方面,原始推文给出两组对比:相比 Fable 5 便宜近 180 倍,相比 GPT 5.6 Sol 便宜约 100 倍。由于原文未提供具体单价,这组数字可能基于特定长上下文或高并发场景下的估算,但量级差异已说明 DeepSeek 在推理成本上继续维持激进策略。

为什么重要

这次更新有两个关键信号。其一是能力曲线:Terminal-Bench 2.1 是比一般对话评测更贴近生产环境的测试,AI 代理需要在真实终端里完成软件安装、文件操作、脚本调试等任务,82.7 分意味着 V4-Flash 的 agent 执行能力已进入第一梯队,而四个月前它还只是中游水平。

其二是定价策略:当头部模型陆续进入“高价高性能”区间时,DeepSeek 选择把接近第一梯队的推理能力以两个数量级的成本差对外输出。这会直接压缩中小团队使用闭源高端 API 的预算空间,也让“自建推理 + 开源模型微调”的路线更有吸引力。

另外需要注意到,V4-Flash 目前不走开源、只走 API 的策略,与 DeepSeek 此前 V3 系列先开源再商业化的节奏略有不同。这可能意味着 DeepSeek 正在尝试将能力领先的模型作为商业化主力,而把上一代模型继续开源。

对用户/开发者/创作者的影响

对开发者来说,最直接的变化是 agent 类应用的单次任务成本有望大幅下降。如果你正在构建需要高频调用模型完成终端操作、代码生成或数据处理的工具,V4-Flash 目前是值得压测的对象——尤其是官方只开放 API,意味着可以快速接入。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对技术决策者而言,需要重新评估“闭源高端 API + 少量调用”与“低价 API + 大量迭代”两种路径的性价比。Terminal-Bench 的高分并不保证所有业务场景都能复现,建议在自身任务集上做小规模对比,再决定是否迁移。

对普通用户而言,短期影响是间接的:更低价的模型调用成本,通常会让下游产品以更低价格提供 AI 功能,或者把 AI 嵌入到更细碎的使用场景中。至于“比 GPT 5.6 Sol 便宜 100 倍”这类说法,目前公开信息仅来自推文作者,建议以官方计价页为准。

值得关注的后续

首先,开放权重版本何时发布。V4-Flash 目前仅限 API,如果后续放出权重,本地部署的 agent 工作流将获得新选择,也会对开源社区的微调生态产生直接影响。

其次,Terminal-Bench 82.7 分能否带动 API 调用量增长。观察 DeepSeek 是否公布定价页更新、限流策略和稳定性数据,会比单一得分更能说明商业化意图。

最后,竞品的价格回应。Fable 和 GPT 系列如果跟进降价,可能会引发新一轮 API 价格调整,届时对整个 agent 开发成本结构的影响将比单款模型发布更大。

来源:@Alvin0617

celebrityanime
celebrityanime
文章: 16565

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注