DeepSeek V4 Pro 编程测评夺亚:分数仅输 Kimi K3,成本却只有对手十四分之一

CLUE团队发布的SuperCLUE-Terminal中文编程测评中,DeepSeek-V4-Pro-0813以51.52分位列第二,仅落后榜首Kimi K3约9分,但单次调用成本约1.42元,约为对手的十四分之一,用“准顶级分数”和“极低价格”挑起了编程大模型的新一轮性价比竞争。

一句话看懂:CLUE团队发布的SuperCLUE-Terminal中文编程测评中,DeepSeek-V4-Pro-0813以51.52分位列第二,仅落后榜首Kimi K3约9分,但单次调用成本约1.42元,约为对手的十四分之一,用“准顶级分数”和“极低价格”挑起了编程大模型的新一轮性价比竞争。

事件核心:发生了什么

2026年8月14日,CLUE团队公布了最新的SuperCLUE-Terminal中文AI终端编程测评榜单。该榜单面向国内开发者,使用全本地真实编程任务,并通过Claude Code统一运行框架,考察模型在中文需求理解、任务规划、工具调用和代码调试等方面的完整能力。每个测试问题需要模型完成50至110轮交互,单次完整运行耗时半小时到一小时半,以模拟日常开发中的复杂工作流。

结果显示,Kimi K3以60.61分排名第一,DeepSeek-V4-Pro-0813以51.52分紧随其后,高于GLM-5.2的48.48分和旧版DeepSeek-V4-Flash的46.46分。更受关注的是成本:DeepSeek-V4-Pro-0813每道题的调用成本约为1.42元,大约是Kimi K3的十四分之一、GLM-5.2的十六分之一。测评覆盖前端页面、3D游戏、工程脚本修改等真实需求,在游戏开发场景中,交互逻辑、碰撞检测、计分与结算功能均能正常运行,页面配色和交互反馈也已脱离模板化风格,个别创意绘图类任务存在结构性小问题,但整体完成度靠前。

为什么重要

这张榜单的意义不只是排名,而是把编程模型的竞争从“分数高低”拉到了“成本效率”层面。头部模型的分数差距通常只有个位数,但DeepSeek-V4-Pro-0813的调用成本与排名第一的产品相差超过一个数量级,这意味着“顶级能力”和“顶级价格”之间第一次出现了明显的空隙。对预算敏感的中小团队和独立开发者来说,他们不必再为每一轮代码生成支付高昂算力费用,就能获得接近第一梯队的编码体验。

这也给同赛道竞品施加了直接压力:如果Kimi K3或GLM-5.2的价格体系不调整,面对DeepSeek-V4-Pro-0813的性价比优势,开发者迁移API、更换默认编程模型的门槛会变得很低。编程大模型的商业化竞争,正在从单纯的技术指标比拼,转向“技术分+单位成本”的综合博弈。

对用户/开发者/创作者的影响

对开发者而言,最直接的变化是编程类API的调用成本门槛被拉低。日常调试、批量代码审查、多轮交互式开发等高频场景,过去受限于费用只能在少数关键任务中使用AI,现在可以更频繁地嵌入工作流。独立开发者和小型工作室也能在有限的预算内,把接近第一梯队的模型接入到实际项目中,用于前端页面搭建、游戏原型开发或工程脚本维护。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者来说,测评中展示的3D游戏生成、页面交互反馈等能力说明,当前编程模型已经能处理“从需求描述到可运行成品”的完整链路。不过,创意绘图类任务中仍存在结构性问题,这意味着在涉及视觉细节和复杂设计约束的场景下,人工修正仍是必要环节。对于企业技术负责人,这次的性价比数据可以作为模型选型和采购谈判的参考,但建议先在自身业务场景中做小范围验证,再决定是否大规模替换现有编程工具链。

值得关注的后续

目前公开信息显示,DeepSeek-V4-Pro-0813的API是否已全面开放、定价是否长期稳定,仍有待官方进一步说明。后续可以重点观察三点:一是该模型的低成本是否来自推理优化或量化压缩,而非短期补贴,这将决定价格能否持续;二是Kimi K3、GLM-5.2等竞品是否会跟进降价或加速推出新版本;三是SuperCLUE-Terminal榜单是否会在更多类型的真实开发任务上继续扩展,以验证模型在更长尾场景中的泛化能力。编程模型的价格战一旦开启,对开发者和企业用户来说,选择空间会比过去大得多。

来源:AIbase

celebrityanime
celebrityanime
文章: 18339

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注