一句话看懂:DeepSeek 于 7 月 31 日发布 V4 Flash 0731 迭代版本,在 Artificial Analysis 智能指数上拿下 50 分,比 4 月版提升 10 分,与 GPT-5.6 Luna 仅差 1 分,但 API 单任务成本约低 60%。同等价格下性能大幅跃升,是这次更新最值得关注的点。
事件核心:发生了什么
据 Artificial Analysis 实测,DeepSeek V4 Flash 0731 在智能指数上取得 50 分,较 4 月发布的 V4 Flash(40 分)跃升 10 分,同时领先自家的 V4 Pro 6 分,与 OpenAI 的 GPT-5.6 Luna(最高档 51 分)和 GLM-5.2(最高档 51 分)只差 1 分,并已进入该机构“智能 vs 单任务成本”的帕累托最优曲线。
模型架构和定价均未改变:仍是 284B 总参数、13B 激活参数,支持 1M token 上下文,API 定价保持每百万输入/输出 token 0.14/0.28 美元,缓存命中价格低至 0.0028 美元,即 98% 折扣——比行业常见的 90% 缓存折扣更激进。最大的提升来自 agentic 能力:GDPval-AA v2 评分从 1189 升至 1559,Terminal-Bench 2.1 达 79%,τ³-Bench Banking 升至 31%。同时,运行智能指数所需的输出 token 减少了 12%,幻觉率下降 12 个百分点,但整体准确率不变,说明改进来自更少“胡编”,而非更高“答对率”。
为什么重要
这次更新把开源模型与闭源前沿的差距压缩到 1 分以内,且没有靠涨价或更换架构实现。DeepSeek 保持相同定价和推理成本,纯粹通过训练优化换来了智能水平的大幅提升,这对整个大模型定价体系构成压力——尤其是它把缓存命中折扣打到 98%,进一步拉低了高频调用场景的实际使用成本。
对开源生态而言,DeepSeek 预计在未来数周发布完整权重。一旦开放,它将成为开源权重模型中智能指数第二高的存在(仅次于 Kimi K3 的 57 分)。这意味着开源社区的“可复现天花板”短时间内被明显抬高,企业用户不必走闭源 API 也能获得接近前沿的模型能力。
对用户/开发者/创作者的影响
对开发者来说,最直接的变化是 agentic 工作流和长任务自动化的成本门槛下降:在智能接近 GPT-5.6 Luna 的情况下,DeepSeek 一方 API 的单任务成本约低 60%,对于频繁命中缓存的调用场景,优势还会进一步放大。如果你在跑需要大量循环调用模型的多智能体系统,这个价格差会直接体现在账单上。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者和普通用户而言,1M 上下文窗口和更低的幻觉率意味着长文档处理、批量内容分析类任务更可靠,也更便宜。但需注意,当前版本仅支持文本输入输出,图像生成和多模态任务仍需另选模型。
对企业技术决策者来说,这套“开源权重 + 激进定价”的组合,让“先用 API 验证、再私有化部署”的路径变得更顺畅。
值得关注的后续
第一,权重能否如约在数周内开放,以及开放后社区微调和量化版本的实际表现,将决定它能否真正改变开源生态的竞争水位。
第二,OpenAI 在 7 月 31 日已对 GPT-5.6 Luna 降价 80%,DeepSeek 的成本优势会被部分抵消,但两者单任务成本仍相差约 60%。后续闭源厂商是否继续跟进降价,是观察重点。
第三,DeepSeek V4 Flash 0731 与 GLM-5.2、Gemini 3.6 Flash 的分数非常接近,智能指数第一梯队正在变得拥挤,未来几个月的排名变化比单次发布更值得跟踪。


