构建 Ed-O-Meter:编写自己的 LLM 基准测试笔记

一位开发者发现公共大模型基准测试越来越不可信,于是用自己编写的私有测试集做了一套轻量评测工具 Featherbench,并公开了 Ed-O-Meter 排行榜,用可复现的方式对比模型质量、速度、成本和拒答率。

一句话看懂:一位开发者发现公共大模型基准测试越来越不可信,于是用自己编写的私有测试集做了一套轻量评测工具 Featherbench,并公开了 Ed-O-Meter 排行榜,用可复现的方式对比模型质量、速度、成本和拒答率。

事件核心:发生了什么

这个项目来自开发者 Simon Willison 关于“基准测试污染”的讨论之后——公共榜单如 MMLU、GPQA、SWE-bench 的分数,可能因为模型已经在训练时见过类似题目而虚高。Featherbench 是作者自己开发的单文件评测工具,约 1000 行 Python 代码,任务以 JSON 格式编写,共 28 个任务,按现实使用场景划分成 5 个类别,每个任务至少运行一次,并如实展示不确定性而非抹平误差。

测试通过 OpenRouter 统一调用不同模型,使用同一个 API Key 即可完成对比。模型拒答会被直接判为失败。所有运行结果和榜单数据都公开在 Ed-O-Meter 页面上。项目采用 MIT 许可证,便于他人复现。

为什么重要

公共基准分数已经成为一场军备竞赛:模型实验室有动力针对公开榜单优化,测评结果难以反映真实业务场景。文章引用了 Simon Willison 的“鹈鹕骑自行车 SVG”测试——因为场景足够冷门,模型无法靠记忆取胜,反而暴露了真实能力。Featherbench 提供了一个更务实的思路:任务在模型发布后编写,内容基于个人真实需求,比如“给妈妈找一个酸面团面包配方”,让模型无法通过背诵来刷分。

对生产环境来说,这个思路更贴近选型需求。大规模调用大模型时,关键是找到“够用且最便宜”的模型,而不是榜单上分数最高但成本超预算的旗舰模型。

对用户/开发者/创作者的影响

开发者和企业在做模型选型时,不必再依赖抽象的学术指标。Featherbench 展示了一种低成本、可复制的方法:用自己业务里的真实任务写一份 JSON 测试集,固定提示词、评分标准和路由逻辑,只替换模型变量,就能得到针对自身场景的横向对比,同时记录 token 消耗、延迟和拒答行为。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

使用 OpenRouter 这类聚合 API,可以避免同时接十几家云厂商的繁琐流程。任务用 JSON 而非代码编写,降低了编写门槛,非工程师也能参与到测试集维护中来。

值得关注的后续

目前公开信息显示,Ed-O-Meter 的 28 个任务尚未覆盖多轮对话、工具调用等复杂场景,这类能力恰恰是很多生产应用的关键。后续可以观察:Featherbench 是否会扩展任务类型;榜单是否会随新模型发布持续更新,形成可对照的趋势曲线;以及更成熟的商业评测平台(如 Inspect AI、Promptfoo、Braintrust)是否会引入这种“私有任务集+单变量控制”的做法,让评测既保留平台能力,又提供可审计的透明度。

来源:HN Algolia · AI 24h</a

celebrityanime
celebrityanime
文章: 18317

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注