一句话看懂:Homebench 是一款面向本地大模型的零配置基准测试工具,能在终端里一键测出“已安装模型”的速度、内存占用和质量分数,并以排行榜呈现,帮你判断自己电脑上哪个模型既快又靠谱。
事件核心:发生了什么
开源开发者 david-g-3654 在 GitHub 上发布了 Homebench,并引发 Hacker News 社区讨论。这是一个本地优先的 LLM 测评工具:安装后只需执行 homebench 命令,它就会自动发现 Ollama、LM Studio、llama.cpp、vLLM 或任意 OpenAI 兼容服务器中已经拉取的模型,运行一套包含 31 个确定性评分任务的质量测试,同时测出输出速度(tok/s)、首 token 延迟(TTFT)和内存占用,最终在终端渲染出实时对比排行榜。
Homebench 强调零配置、无 API key、无云端依赖。示例数据来自一台 16GB 内存的 Apple M1 笔记本,通过 Ollama 运行:llama3.2:latest 得分 75%,约 16.8 tok/s,内存占用 2.4GB;同平台的 smollm3 得分 38%,速度相近但质量差距明显。除了快速测评,它还支持批量吞吐测试、质量套件扩展、历史记录 diff、JSON/Markdown 导出,以及可选的 LLM-as-judge 开放式任务评分。
为什么重要
本地大模型生态一直缺少“一站式”的横向对比工具。llama.cpp 自带的 llama-bench 只测速度,不考虑回答质量;lm-evaluation-harness 虽然能做深度质量评估,但对普通用户来说部署复杂,也没有围绕实际本地运行器设计。Homebench 把“速度、内存、质量”三个用户最关心的维度放进同一个终端界面,在真实硬件和真实推理环境下给出答案。
这种做法也体现了本地 LLM 应用的一个转折:从“能不能跑”转向“哪个更合适”。当越来越多用户在自己的笔记本上运行模型时,云端基准成绩不再等于本地体验,实测本机表现才是可靠依据。Homebench 的定位正好填补了这个空白,同时推动模型评测从学术化、重型化走向轻量化和个人化。
对用户/开发者/创作者的影响
普通用户可以用它快速筛选适配自己电脑的模型,比如在 Ollama 拉取多个模型后,直接比较谁的质量高、谁更省内存、谁响应更快。开发者则能在选择端侧推理方案时,用可重复的量化指标评估不同模型和后端服务,并可通过自定义任务包接入业务场景,或通过 OpenAI 兼容接口评测私有模型。创作者如果依赖本地模型生成摘要、邮件或文案,开启 LLM-as-judge 后可以评估开放式生成质量,而不只是看选择题式评分。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
由于 Homebench 支持批量吞吐测试和命令行输出,也很适合集成进 CI 流程,用来监控模型版本更新后的性能回退。相比需要手动拼凑脚本的旧流程,这明显降低了本地模型选型与回归测试的门槛。
值得关注的后续
目前公开信息显示,Homebench 仍处于早期阶段,后续值得观察三点:其一,内置的 31 个任务是否会随社区反馈持续扩充,避免模型“刷榜”;其二,Ollama、LM Studio 等主流运行器是否会将其官方集成或引入类似功能;其三,社区能否形成共享的“个人硬件排行榜”,让某类电脑的典型性能数据成为新用户选型时的参考。如果这三个方向进展顺利,Homebench 有可能成为本地模型评测的常用入口。
来源:Hacker News


