一句话看懂:8月15日,独立博主@NFT_Chen 公布了一套针对 DeepSeek V4 Pro 0813 的配置优化方案:通过开源插件动态控制工具暴露数量,能让同款模型跑分从 91 提升至 98/99。这件事提示我们,大模型评测分数与运行环境强相关,默认配置远不是模型能力的上限。
事件核心:发生了什么
据 @NFT_Chen 的实测,DeepSeek V4 Pro 0813 在默认配置下表现不佳:一次暴露 25 个工具时,模型在复杂任务中频繁出现“思维链全是 let me”的低质量输出,评测分数仅 91。而采用“先只暴露 2 个工具,等待模型完成首次工具调用后再解锁全部工具”的策略后,同一模型在同一套题上的分数直接升至 98/99。该博主还给出了一个开源插件方案:在 GitHub 搜索 dsh-routing-suite(需搭配 DeepSeek Harness),即可自动实现上述“窄工具集开局、按任务类型挂档解锁”的调度逻辑。
横向对比方面,该博主称优化后的 V4 Pro 可以超过 Kimi K3(92)、K2.7(94)、GLM-5.2(91),追平 GPT-5.6 Sol 与 Claude Fable 5。推文同时提到,V4 Pro 公开发布版本与灰度测试版本之间存在可感知的差异,并暗示极简模式下背后可能有多种可切换的行为模式。
为什么重要
这一现象说明,大模型的实际表现并非只由参数和训练数据决定,部署层的“工具暴露策略”和“脚手架设计”同样会显著影响推理质量。给模型过多工具权限,信息过载可能让模型陷入低效决策,这一点与人类新手面对过多系统权限时无从下手颇为相似。
对行业而言,这件事有两个直接意义:其一,评测分数必须在固定配置下对比,否则数字无法真实反映模型能力;其二,国内大模型在灰度测试与公开版本之间的体验落差,已经从一个模糊的用户感受,变成了有数据支撑的工程问题,这对后续版本的发布流程和部署工具链提出了更高要求。
对用户/开发者/创作者的影响
对 AI 应用开发者来说,这不是一个“换模型”的问题,而是一个“调配置”的问题。在接入 DeepSeek V4 Pro 或类似工具密集型模型时,建议不要直接开放全部工具,而是先观察模型如何选择第一个动作,再逐步增加可用工具,这一策略可能比更换更强模型带来更明显的效果提升。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户来说,如果你在官方产品中体验 V4 Pro 感觉“不如预期”,可以了解是否使用了第三方极简界面或简化版工具链,配置差异很可能就是体验差异的主因。对创作者和评测博主而言,则需要警惕单一配置下的跑分数据,注明测试条件比分数本身更重要。
值得关注的后续
目前公开信息显示,这套优化方法尚未得到 DeepSeek 官方确认,dsh-routing-suite 插件也仍在社区传播阶段。后续值得观察三个点:
第一,DeepSeek 官方是否会调整 V4 Pro 的默认工具暴露逻辑,将其改成自适应调度;第二,其他模型厂商是否会跟进类似“动态工具解锁”的配置策略,把它作为正式功能;第三,这一插件在除评测以外的真实业务场景中,是否还能稳定复现两位数的分数提升,还是仅仅对测试集有效。
来源:@NFT_Chen


