也许我们误解了DeepSeek-V4.1-Flash,罪魁祸首其实是它

开发者对 DeepSeek-V4.1-Flash 的实测出现明显波动,同一模型在 Codex 与 DeepSeek Harness 两条调用链上的表现差异巨大,问题可能不完全出在模型本身,而在于承载它的工具链。

一句话看懂:开发者对 DeepSeek-V4.1-Flash 的实测出现明显波动,同一模型在 Codex 与 DeepSeek Harness 两条调用链上的表现差异巨大,问题可能不完全出在模型本身,而在于承载它的工具链。

事件核心:发生了什么

掘金作者“阿灿在吗”此前花费超 50 小时、消耗 5000 万以上 Token 测试 DeepSeek-V4.1-Flash,给出“达到 GPT-5.6 sol 级别智商”的评价。但 9 月 18 日凌晨的一次长任务中,他与模型反复拉扯两小时仍未改完,随后用同一测试用例复测 High 与 Max 档位,结果明显不如 9 月 10 日群友测试时的表现。

为定位原因,他把 API 接入 Codex 重跑,并对同一工作区的两次 DSH(DeepSeek Harness @deepseek-ai/dsh@0.1.5-rc.2)+ deepseek-flash + Max 进行统计。数据显示:Codex 第二次耗时 20 分钟、消耗 15.7M Token、花费约 1.21 元,每百万 Token 单价约 0.07 元;DSH 两次分别为 13 分钟/13.4M/0.87 元和 16 分钟/32M/1.31 元,单价约 0.04 元,缓存命中更高。但效果上,即便 Codex 第二次已“天差地别”于其第一次,仍好过 DSH 的任何一次。

为什么重要

这组对比把矛头从“模型是否被降智”转向了“框架是否拖后腿”。作者原本怀疑 DSH 拖累 DeepSeek-V4.1-Flash,但 Codex 第二次结果也出现大幅波动,说明单次结果不足以定论。目前公开信息显示,测试样本仅两次,无法得出完全可靠结论。不过它揭示一个现实:大模型的推理能力波动,可能同时来自训练后的后训练版本、推理框架、插件生态和上下文工程。对靠 API 构建 AI 应用的开发者来说,模型选型之外,Agent 框架的调度与缓存策略同样是能力上限的一部分。

对用户/开发者/创作者的影响

普通用户体感最直接:同一个模型,换个客户端或工作流,产出质量可能差一截。开发者若要把 DeepSeek-V4.1-Flash 用于长任务自动化,建议固定工作区、会话与插件配置,并保留多轮对照统计,而不是凭单次结果判断模型强弱。创作者在图像生成、代码生成这类高方差任务上,也应预期“抽卡式”波动。成本方面,DSH 的缓存命中率更高,单价更低,但效果稳定性尚未被证明。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 DSH 能否推出更稳定的创造模式或官方推荐配置,作者认为官方至少要做到 90 分;二是 DeepSeek 是否会发布能稳定发挥 V4.1-Flash 智商的后训练版本;三是社区是否会出现深度调优 DSH 的实践,让“1+1 大于 2”真正成立。目前这些都是待验证问题。

来源:juejin

celebrityanime
celebrityanime
文章: 24739

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注