一句话看懂:ARC Prize 公布了 DeepSeek V4.1 Flash 在 ARC-AGI 两项基准上的成绩,准确率较前代明显提升,但单任务推理成本上涨约 250%,性能与价格之间的取舍再次成为焦点。
事件核心:发生了什么
根据 ARC Prize 在 X 上发布的信息,DeepSeek 的 V4.1 Flash 在 ARC-AGI(Verified)评测中取得两组数据:ARC-AGI-2 准确率 72.9%,单任务成本 0.13 美元;ARC-AGI-1 准确率 94.5%,单任务成本 0.07 美元。作为对比,V4 Flash 的最好成绩在 ARC-AGI-1 上被提升了 5.5 个百分点,在 ARC-AGI-2 上提升了 11.5 个百分点,但每个任务的成本大约高出 250%。这些数字均由 ARC Prize 一方发布,目前公开信息显示尚未看到 DeepSeek 官方同步披露完整评测细节。
为什么重要
ARC-AGI 系列测试强调抽象推理和样本外泛化能力,和单纯刷语言类题库不同,成绩提升更能反映模型在“没见过的新题”上的推理表现。ARC-AGI-2 提高 11.5 个点,说明这一代模型在推理路线或训练策略上确有变化。但成本同步上涨 250%,也提醒行业:推理能力的提升往往伴随更多算力消耗,评测分数不再是唯一指标,单位任务的性价比正成为模型选型的重要维度。对以 API 形式提供服务的厂商而言,如何在开源、闭源两条路线上平衡准确率与推理成本,会直接影响商业化空间。
对用户/开发者/创作者的影响
对开发者来说,ARC-AGI 成绩不能直接等同于日常任务表现,但它是一个可参考的推理能力信号。如果应用场景涉及复杂逻辑、规划或多步推理,V4.1 Flash 值得纳入测试;若调用量很大,需要先核算 0.13 美元/任务这类成本是否会吃掉利润。对企业采购方,这类数据可用于对比不同大模型 API 的性价比;对内容创作者,推理能力更强意味着 Agent、自动化工作流等工具的稳定性可能提升,但短期内不必指望价格立刻下降。目前公开信息显示,这一价格仍是评测口径下的单任务成本,实际 API 定价需以官方为准。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 DeepSeek 是否公布 V4.1 Flash 的完整技术细节和正式 API 定价;二是 V4 Flash 与 V4.1 Flash 的定位是否会拉开,老版本是否降价或继续保留;三是其他厂商是否在 ARC-AGI 上跟进对标,推动推理型模型的成本进一步下探。


