DeepSeek V4 Flash 0731

DeepSeek 于 7 月 31 日发布 V4 Flash 0731 模型,在 ARC-AGI-1 Semi-Private 评测中拿到 89.0% 准确率,单任务推理成本仅 0.02 美元;在难度更高的 ARC-AGI-2 上达到 61.4%,单任务成本 0.04 美元。值得关注的不只是分数,而是“接近顶…

一句话看懂:DeepSeek 于 7 月 31 日发布 V4 Flash 0731 模型,在 ARC-AGI-1 Semi-Private 评测中拿到 89.0% 准确率,单任务推理成本仅 0.02 美元;在难度更高的 ARC-AGI-2 上达到 61.4%,单任务成本 0.04 美元。值得关注的不只是分数,而是“接近顶尖推理水平的同时把单位成本压到了极低”。

事件核心:发生了什么

根据 arcprize.org 发布的评测结果,DeepSeek V4 Flash 0731 提供了三种推理强度设定:Max、High、Low。在 ARC-AGI-1 Semi-Private 上,三档准确率分别为 89.0%、87.0%、84.0%;在 ARC-AGI-2 Semi-Private 上,分别为 61.4%、56.0%、46.0%。其中 Max 档位的单任务 API 成本为 0.02 美元(ARC-AGI-1)和 0.04 美元(ARC-AGI-2)。ARC-AGI-3 没有公布成绩。

ARC-AGI-2 由 ARC Prize 基金会推出,比 ARC-AGI-1 更难,专门设计用来排除模型的记忆型解题路径,强调抽象推理与举一反三能力。DeepSeek V4 Flash 0731 在 ARC-AGI-2 上取得 61.4%,是目前公开评测里少数突破 60% 的模型之一。“Flash”命名和定价也表明它定位为高性价比的轻量推理版本,而非旗舰级模型。

为什么重要

这次评测结果的意义在于“低成本 + 强推理”的组合。过去两年,模型在 ARC-AGI 这类基准上提分,往往依赖更长的测试时计算(test-time compute)和更高推理成本。DeepSeek V4 Flash 0731 以不到 0.05 美元的单任务成本,在 ARC-AGI-2 上拿到 60% 以上成绩,说明抽象推理能力的获取不再只属于高溢价模型,性价比路线同样能逼近第一梯队。

对行业而言,这会影响两类判断:一是模型能力评估,ARC-AGI-2 正逐渐成为比传统 MMLU 类题库更受关注的推理标尺,DeepSeek 主动提交成绩,说明国内模型厂商开始把“可验证的推理能力”作为竞争焦点;二是商业化逻辑,如果 Flash 系列的真实 API 价格与评测成本一致,那么大规模智能体(Agent)任务、批量数据处理类应用的算力成本结构会被重新定价。

此外,得分随推理强度档位平滑变化(Max 到 Low 相差约 15 个百分点),也为开发者提供了一种能力-成本可调的实用范式。

对用户/开发者/创作者的影响

对开发者和 API 用户来说,最直接的影响是:在以抽象推理为核心的任务(如代码生成、逻辑规划、结构化数据转换)中,可以用更低成本接入接近顶级水准的模型。三档推理强度设定尤其适合按场景调节——高并发、低敏感任务可以切到 Low 档降本,复杂推理再升级到 Max。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对做智能体应用、自动化工作流工具的团队,ARC-AGI-2 这类基准对应的恰恰是“看一遍示例就能迁移解题”的能力,这正是 Agent 落地中最需要的泛化能力。低单价意味着更大规模的试错和调用,不再需要因为单次推理太贵而限制 Agent 的运行次数。

普通用户层面,Flash 系列通过降低调用成本,可能让更高智能的 AI 助手进入更多免费或低价产品中,但现阶段这一结论还有待 API 正式开放后验证。

值得关注的后续

1. DeepSeek V4 Flash 0731 是否会把评测中的低价策略原样落地到开放 API,还是仅作为评测成本展示,需要等待官方接口定价确认。

2. ARC-AGI-3 目前没有成绩,后续是否会补测,以及

celebrityanime
celebrityanime
文章: 18313

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注