单个 AMD MI300X 上的 DeepSeek V4 闪存

硬件租赁商和开发者正在算一笔账:用单个 AMD MI300X 自托管 DeepSeek V4 Flash 服务用户,按 DeepSeek 官方 API 价格计算,成本已逼近"打平"区间;但吞吐量若达不到约 1500 TPS,这门生意依然不赚钱。

一句话看懂:硬件租赁商和开发者正在算一笔账:用单个 AMD MI300X 自托管 DeepSeek V4 Flash 服务用户,按 DeepSeek 官方 API 价格计算,成本已逼近”打平”区间;但吞吐量若达不到约 1500 TPS,这门生意依然不赚钱。

事件核心:发生了什么

在 Hacker News 的讨论中,有开发者基于”DeepSeek V4 Flash 0731″版本,测算了一台 AMD MI300X 作为专用推理服务器时的经济性。具体假设是:处理 200 万输入 token、100 万输出 token 和 9850 万缓存 token,按 DeepSeek API 定价计算总费用约 0.84 美元;而在一台 MI300X(按时租约 2 美元/小时)上,用社区框架跑同样的 token 量约需 1500 秒,硬件成本约 0.83 美元。两者几乎持平,但这只是”硬件成本”,还没算上带宽、运维和利润率。有回帖指出,按当前框架实际吞吐(约 90 TPS 中位数流)远不够商业化,至少需要把吞吐提升到约 1500 TPS,也就是通过更大批量处理和优化 kernel,在 20-30 个并发用户、每用户 50-60 TPS 的条件下才可能盈利。

为什么重要

这个讨论的价值不在”DeepSeek V4 Flash 能否跑在单卡 MI300X”这个技术事实本身,而在于它把 AI 推理成本从”PPT 参数”变成了可核算的硬数字。它揭示了一个关键趋势:单张 192GB 显存的 MI300X 已经能承载主流 MoE 模型的原始权重推理,这意味着中小团队可以绕开昂贵的多卡集群,用约 2 美元/小时的租卡成本自建专用推理服务。同时,DeepSeek 的低 API 定价(缓存 token 仅 0.0028 美元/百万)压缩了转售者的利润空间,但相比其他推理供应商对缓存 token 高 10 倍的定价,自托管依然有潜在套利空间。讨论中还提到一个容易被忽略的点:DeepSeek 通过免费/低价 API 收集到的数据,对其模型迭代的价值可能远超 token 收入——这一点是自托管模式无法复制的。

对用户/开发者/创作者的影响

对普通用户,这意味着通过 API 使用 DeepSeek 的价格短期内不太可能大涨,因为自托管方案已经形成了成本锚点。对开发者,尤其是做 RAG 或高缓存命中率应用的团队,自托管 V4 Flash 在成本上第一次有了可与官方 API 正面比较的可行性;如果隐私合规要求高(如医疗、法律或金融领域),本地或单机自托管会成为更现实的选择。对依赖廉价 token 做批量处理的创作者和自动化工具,需要关注吞吐而不是单纯看单次价格:90 TPS 和 1500 TPS 决定了应用形态是”异步批处理”还是”实时交互”。对企业采购而言,二手 A100 或租用 MI300X 这类高显存卡来跑开源权重模型,可能是数据隔离需求下最划算的路径之一。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,这个成本测算基于社区框架,尚未包含大规模并发下的真实性能数据。下一步值得观察三点:一是该框架能否通过高批量优化把单机吞吐提升到接近 1500 TPS,如果达到,单机推理的商业模型会真正成立;二是 DeepSeek 的 API 定价是否会被自托管成本倒逼进一步下调,或反过来,官方 API 是否会通过收紧缓存策略来保护收入;三是 MI300X 的租用供给是否扩大——讨论中已有 2 卡 1.65 美元/小时的租赁报价出现,若供给增加,硬件成本还会继续下降,届时不只 DeepSeek,其他 MoE 模型(如 Qwen 或 Llama 系列)的单卡推理也会进入同样的成本竞赛。

来源:hackernews

celebrityanime
celebrityanime
文章: 16865

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注