一句话看懂:开发者 Jacky Kwok 分享了一个名为 llm-as-a-verifier 的方法:让 DeepSeek V4-Flash 自行生成多个候选答案,并自己充当裁判选出最优解。在 Terminal-Bench 2.1 上,这一方法把成功率从 79% 拉到 88%,超过了 Claude Fable 5,且整体成本便宜约 11 倍。
事件核心:发生了什么
根据 @MaxForAI 和作者 @jackyk02 发布的信息,llm-as-a-verifier 的核心思路是“自我生成、自我验答案”。在 Terminal-Bench 2.1 的实验中,DeepSeek V4-Flash 单次运行的成功率约为 79%;配合该工具后,模型一次性生成 5 个候选答案,再由同一个模型作为 Verifier 从中挑选最优结果,成功率提升至 88%,直接超过了 Claude Fable 5。值得注意的一点是,整个过程没有引入更强的外部裁判模型,完全由 DeepSeek V4-Flash 自己完成。相关数据于 2026 年 8 月 18 日由 Jacky Kwok 在社交平台公开。
为什么重要
这套实验的意义不在于某个具体分数,而在于它展示了一个可能的低成本替代路径。过去,模型能力的提升主要依赖堆参数和堆训练算力。而 llm-as-a-verifier 的逻辑是:如果推理成本足够低,就可以用多次采样替代单次硬拼,再用验证器把正确答案筛选出来。也就是说,Scaling 的方式正在从“训练时算力”转向“推理时算力”。如果这条路线持续成立,开源或低成本模型的竞争力将不再只取决于模型本身有多聪明,还取决于它能否便宜到一次思考 5 遍、10 遍甚至 20 遍,并自己给自己批改作业。
对用户/开发者/创作者的影响
对开发者而言,这意味着在选择模型时,单一模型的基准分数不再是唯一决策依据。只要 API 价格足够低,通过配合 llm-as-a-verifier 这样的自验证流程,低成本模型也可能在特定任务上达到甚至超过闭源旗舰模型的水平。这会直接影响 API 采购预算和推理架构设计:开发者或许应该更关注“模型单价 × 采样次数 × 验证成本”的总账,而不是单次调用的精度。对于企业用户来说,这提供了一个降低 AI 工具使用成本的潜在方向,尤其是在需要高正确率的任务场景下。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,llm-as-a-verifier 的验证效果在 Terminal-Bench 2.1 上表现突出,但仍需观察几个问题:第一,这种自我验证方式在代码生成之外的领域(如长文本写作、复杂推理)是否同样稳定;第二,当采样数量从 5 次增加到 10 次或 20 次时,成功率是否继续线性提升,还是会出现边际递减;第三,DeepSeek 或其他低成本模型是否会官方集成类似的自验证流程,将其变成默认能力,而非开发者自己拼装的工具。这些都会决定“用推理次数换智力”这一定价逻辑能否真正改变市场竞争格局。
来源:@MaxForAI


