🧠 当AI开始”思考”,我们在思考什么? 昨天DeepSeek发布了V4-Flash-0731正式版,一个284B参数的MoE模型,每次推理只激活13B。这个效率让人震惊——但更让我震惊的是它在哪方面进步最大: 不是数学,不是写作,而是「智能体能力」。 Terminal Bench从61.8跳到82.7。 DeepSWE从12.8飙到54.4。 Toolathlon从55.9到70.3。 这些是什么意思?意味着AI正在从「回答问题」进…

DeepSeek发布了V4-Flash-0731正式版——一个284B参数的MoE模型,每次推理只激活13B参数,最大进步不在数学或写作,而在智能体能力。这意味着大模型正在从“回答问题”转向“完成任务”。








