🧠 当AI开始”思考”,我们在思考什么? 昨天DeepSeek发布了V4-Flash-0731正式版,一个284B参数的MoE模型,每次推理只激活13B。这个效率让人震惊——但更让我震惊的是它在哪方面进步最大: 不是数学,不是写作,而是「智能体能力」。 Terminal Bench从61.8跳到82.7。 DeepSWE从12.8飙到54.4。 Toolathlon从55.9到70.3。 这些是什么意思?意味着AI正在从「回答问题」进…

DeepSeek发布了V4-Flash-0731正式版——一个284B参数的MoE模型,每次推理只激活13B参数,最大进步不在数学或写作,而在智能体能力。这意味着大模型正在从“回答问题”转向“完成任务”。

一句话看懂:DeepSeek发布了V4-Flash-0731正式版——一个284B参数的MoE模型,每次推理只激活13B参数,最大进步不在数学或写作,而在智能体能力。这意味着大模型正在从“回答问题”转向“完成任务”。

事件核心:发生了什么

据@Thuweni1 消息,DeepSeek于近日发布V4-Flash-0731正式版。该模型采用MoE架构,总参数量284B,单次推理仅激活13B参数,效率相当突出。真正值得关注的是它的能力结构变化:在Agent相关基准上,Terminal Bench从61.8升至82.7,DeepSWE从12.8升至54.4,Toolathlon从55.9升至70.3。相比之下,数学、写作等传统能力不再是本次迭代的主要亮点。这些基准分别考察终端操作、软件工程任务和工具调用能力,它们的集体跃升指向一个方向:模型自主完成复杂任务的能力在变强。

为什么重要

这次发布放在两个背景里看更有意义。第一,GPT-5发布后业界反应冷淡,不少人质疑Scaling Law是否到头,但DeepSeek用“激活13B”的效率模型,在Agent能力上实现了大幅提升,说明进步不一定靠无脑堆算力,架构优化和训练策略仍有很大空间。第二,DeepSeek、GLM等开源模型正在从追赶者变成并跑者,闭源模型的优势窗口在收窄。更重要的是,行业竞争重心正在转移:语言能力本身越来越像基础设施,谁能把模型变成可靠的“执行者”,谁才掌握下一阶段的主动权。

对用户/开发者/创作者的影响

对开发者来说,Agent能力的提升直接意味着可以构建更复杂的自动化工作流——从写代码、跑测试到操作工具,这类任务的可靠性正在接近可用线。对普通用户而言,AI不再只是“告诉你怎么做”的助手,而是“直接替你做完”的执行者,这将在办公自动化、数据分析、内容生产等场景带来体验质变。创作者也会感受到变化:AI在工具链中的参与度会加深,比如自动检索素材、调用图片生成API、串联多个服务完成发布流程。推理成本随着效率提升持续走低,这类能力的商业化门槛正在快速下降。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,V4-Flash-0731的完整技术报告和开源权重尚未披露,有几个点值得跟进:其一,API价格和推理速度是否同步优化,这决定中小开发者能否用得起;其二,开源版本何时放出,如果权重开放,开源社区会迅速围绕它开发出大量Agent应用;其三,DeepSWE从12.8到54.4的跳跃幅度很大,后续是否能在真实软件工程任务中复现,需要看更细粒度的评估;其四,竞品是否会跟进“激活参数高效+Agent优先”的技术路线,以及GPT系列如何回应开源模型的紧逼。

来源:@Thuweni1

celebrityanime
celebrityanime
文章: 16566

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注