Hetzner 正在研发 LLM 推理

德国老牌云服务商 Hetzner 推出了一项名为 Hetzner Inference 的实验性 AI 推理 API,目前仅支持一个开源模型,且不提供任何 SLA 或计费。这标志着以低价裸金属服务器闻名的 Hetzner,正试水大模型推理这一基础设施层,可能改变中小开发者的算力选择格局。

Hetzner 正在研发 LLM 推理

一句话看懂:德国老牌云服务商 Hetzner 推出了一项名为 Hetzner Inference 的实验性 AI 推理 API,目前仅支持一个开源模型,且不提供任何 SLA 或计费。这标志着以低价裸金属服务器闻名的 Hetzner,正试水大模型推理这一基础设施层,可能改变中小开发者的算力选择格局。

事件核心:发生了什么

2025 年 7 月 23 日,Hetzner 在其 Experiments 面板中开放了 Hetzner Inference 的实验访问。这是一个兼容 OpenAI API 格式的推理接口,开发者只需创建 API Token 并将客户端 base URL 指向 https://inference.hetzner.com/api/v1 即可使用。目前唯一支持的模型是 Qwen/Qwen3.6-35B-A3B-FP8,这是一款 350 亿参数的 Mixture-of-Experts 模型,实际推理时仅激活 30 亿参数,支持文本和图像输入,拥有 262K 上下文窗口,并使用 FP8 量化权重。该模型在实际测试中表现尚可:首 token 生成中位时间约 153 毫秒,输出速度约 224 token/秒,但作者指出该模型在简单算术问题上仍会出错,属于“小而有缺陷的 LLM”。

Hetzner 明确告知用户:这只是一个实验,没有计费、没有 SLA、无生产保证,仅用于测试系统扩展能力和收集用户需求反馈。

为什么重要

这则新闻之所以值得关注,并非因为模型本身有多强——市面上已有大量性能更优的推理 API。关键在于 Hetzner 的商业模式与行业趋势的匹配。开源大模型的推理正快速变成一种低利润的“硬件商品”,谁能在保持低价格的同时提供稳定 API,谁就占领了开发者心智。Hetzner 的核心竞争力正是精打细算的硬件采购与数据中心运营:它几乎不需要 GPU 的利润率,只要保持硬件利用率。如果一个推理 API 能共享 GPU 算力、避免裸金属闲置,Hetzner 完全可能将这种“低毛利、高规模”的云计算模式复制到 LLM 推理领域。这不仅会冲击现有第三方 API 代理(如 OpenRouter),也可能倒逼传统 GPU 云供应商重新定价。

对用户/开发者/创作者的影响

对开发者而言,最直接的利好是 API 兼容性极高——它完全兼容 OpenAI 的 Python 客户端 SDK,只需要修改 base_url 即可切换。这大大降低了集成和测试成本。Hetzner 的实验版本意味着未来如果正式上线,很可能推出极具竞争力的价格,尤其适合对推理成本敏感的开源项目、个人开发者和初创团队。图像理解能力的加入,也扩展了它在多模态场景下的可用性(例如 OCR、表格识别、简易图像问答)。不过,当前阶段不应将其用于生产环境——没有 SLA、模型会犯错、且 API 参数(如 enable_thinking)尚未得到官方文档支持。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

值得持续观察三点:
1. 硬件细节是否公布:Hetzner 目前公开的 GPU 产品线包括 A100 和 H100,但未披露推理 API 底层具体使用哪款 GPU,以及是否采用量化和流水线并行等优化手段。这将直接影响其定价是否能低于 AWS、GCP 或 Together.ai 等竞品。
2. 模型扩展路线图:如果 Hetzner 后续增加 Llama 4、Mistral Large 等热门模型(特别是 70B 以上级别),说明其有更大规模 GPU 投资和推理集群的计划。
3. 商业化节奏:Hetzner 目前没有计费,意味着它仍在测试需求弹性和成本曲线。一旦定价公布,将是判断其能否真正成为“开发者的 AI 算力平民化选择”的关键节点。

来源:Hacker News

celebrityanime
celebrityanime
文章: 15099

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注