一句话看懂:DeepSeek V4 Pro 0813 的基准测试成绩在 Hacker News 曝光,多项编程与 Agent 任务指标相比前代大幅提升;与同期 Qwen 旗舰模型对比,多数核心项目占优,且价格明显更低,性价比成为最大看点。
事件核心:发生了什么
一份针对 DeepSeek V4 Pro 0813 和 V4 Flash 0731 的基准测试数据在 Hacker News 上引发讨论。Pro 0813 在 HLE(Humanity’s Last Exam,无工具)上拿到 42.7 分,Terminal Bench 2.1 达到 87.9,DeepSWE 62.7,Toolathlon-Verified 74.1,相比 V4 Pro Preview(HLE 37.7、Terminal Bench 72.1、DeepSWE 12.8)提升明显。
网友将其与 Qwen 官方公布的 Qwen3.8-max 数据做了交叉对比:Pro 0813 在 Terminal Bench 2.1(87.9 vs 86.6)、NL2Repo(61.5 vs 55.9)、Toolathlon-Verified(74.1 vs 72.5)、DeepSWE(62.7 vs 56.6)上领先;在 HLE(43.6 vs 42.7)和 Agents’ Last Exam(27 vs 25.7)上小幅落后。讨论者认为,整体水平相当,但 DeepSeek 的定价使它在综合价值上占据优势。
为什么重要
这次曝光的信息有两点值得关注。第一,V4 Pro 0813 在 DeepSWE 上从 Preview 的 12.8 蹿升到 62.7,说明 DeepSeek 近期的迭代重心明显偏向真实软件工程任务和 Agent 工具调用能力,而这正是当前大模型商业化最拥挤的赛道之一。第二,面对 Qwen3.8-max 这样的直接对手,DeepSeek 没有靠激进定价打低价战,而是用接近或略优的基准成绩叠加更低的 API 单价来竞争,这会迫使同级别模型重新评估价格体系。
对用户/开发者/创作者的影响
对 API 开发者来说,如果不需要视觉或多模态能力,DeepSeek V4 Pro 0813 目前是比 Qwen3.8-max 成本更低的文本与代码任务选择。基准数据中它在终端操作、仓库级代码生成、软件工程问题修复等场景表现扎实,适合接入自动化编程、Agent 工作流和复杂工具调用类应用。创作者如果用 AI 辅助写代码或处理长文本,也可以通过官方 API 渠道以更低价格获得接近头部模型的体验。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,DeepSeek 计划调整定价。讨论者直言即使涨价两到三倍,V4 Pro 0813 相比 Qwen3.8-max 仍是更划算的选择,但这一判断建立在基准数据可信的前提下。后续可以观察三件事:一是 V4 Pro 0813 是否正式进入公开 API 并维持现有价位;二是 Qwen 是否会针对性降价或发布 Max 系列的新版本;三是这些基准成绩在实际部署中能否复现,尤其是 DeepSWE 这类任务容易被训练数据泄露影响,需要第三方复测。
来源:hackernews


