一句话看懂:一个名为 Sunk Cost 的网站在 Hacker News 上发布,用户输入日常 token 用量、上下文长度、电价和本机推理速度,它就能估算本地跑大模型多久能比调用云端 API 更划算。它把“买显卡还是付订阅”这笔长期糊涂账,变成了一道可以公开讨论的算术题。
事件核心:发生了什么
该项目(sunkcost.ai)的核心功能是回本测算:用户填写每天消耗的 token 数、期望的上下文窗口、输入输出比例,以及可调假设,包括电价(美元/千瓦时)、云端 API 速度(tok/s)、自测的本机速度,或者直接填写当前每月 API 账单。工具据此给出本地部署的“盈亏平衡点”。
值得注意的是它的数据收集方式:当用户停止输入后,本机速度与账单会上传,但不设 cookie、不记录 IP,只保留请求来源国家,用于改进估算。设置为禁止追踪的浏览器不会发送任何数据。此外,工具还提供“假设 API 价格持续下降”的选项,可调节降价速度。对于缺乏实测数据的硬件,本地速度按“内存带宽 ÷ 每 token 读取字节数”估算,并明确标注为推算值。
为什么重要
过去一年,开源模型与消费级显卡的能力提升,让“本地跑大模型”从极客玩具变成可选项,但决策依据一直模糊:有人只看显卡价格,有人只比 API 单价,忽略了电费、折旧、时间成本和上下文长度对显存的实际占用。Sunk Cost 把变量摊开,让讨论从情绪化的“本地更自由”或“API 更便宜”转向可复算的模型。目前公开信息显示,API 价格仍在下行,这意味着本地部署的回本周期会被不断拉长——这一点被工具显式纳入,比多数对比文章更诚实。
对用户/开发者/创作者的影响
对个人开发者,这是采购前的检查清单:如果每天 token 消耗不高,订阅 API 往往仍占优;高频、长上下文、对数据不出本机有硬需求的场景,本地才可能划算。对企业,它提示把推理成本拆成算力、电力、运维三块,而非只盯 API 报价。对创作者,图像生成、批量改写这类突发高负载任务,用 API 弹性付费可能比养一张长期闲置的显卡更现实。工具本身也提供了一个副产品:用真实账单数据反推自己的实际 token 成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是估算精度:内存带宽公式对 MoE 模型和量化方案是否够准,实测数据积累后结论会不会翻转。二是 API 降价曲线的默认假设是否合理,这直接决定回本年限。三是是否会出现同类工具跟进,把训练、微调甚至端侧小模型的成本也纳入测算。目前公开信息显示,该工具仍在收集用户数据以迭代估算,其结论应视为参考而非定论。
来源:Hacker News


