一句话看懂:AI 推理基础设施公司 Gimlet Labs 宣布完成 3 亿美元 B 轮融资,由 Andreessen Horowitz 领投。该公司主推“异构芯片”推理云,试图在不增加功耗的前提下把大模型推理速度提升数倍,以应对 token 生成量激增带来的算力瓶颈。
事件核心:发生了什么
Gimlet Labs 于 9 月 4 日公开其 B 轮融资结果,金额为 3 亿美元,领投方为 Andreessen Horowitz,参投方阵容包括 Sapphire Ventures、Menlo Ventures、Arm、Samsung Ventures、Tiger Global Management、M12 及 XTX Markets 等十余家机构。值得注意的是,该公司距离上一轮 A 轮融资仅过去约 5 个月,融资节奏明显加快。
Gimlet Labs 定位是“首个为推理而生的多芯片云”,其核心思路是不再依赖单一类型的 GPU 集群,而是将 GPU、近存计算、数据流架构及 CPU 等不同芯片混合部署,并通过软件把模型拆解后分发到最适合的芯片上执行。据公司披露,这套方案在相同功耗下可带来 5-10 倍推理速度提升,或在同等延迟下显著提高吞吐量。
为什么重要
这轮融资的背景是行业算力供需结构正在发生硬转折。Gimlet Labs 援引公开数据指出,过去 12 个月全球 token 月生成量增长了 6 倍,有预测称到 2030 年还将再增长 20 倍。与此同时,AI 数据中心 2025 年已消耗约 18 GW 电力,预计到 2030 年将翻三倍——电力和散热正取代芯片本身,成为制约 AI 规模化的首要瓶颈。
此前行业普遍用训练场景的 GPU 集群来跑推理,但两者的访问模式完全不同。过去两年模型参数从数百亿涨到 3-10 万亿,上下文窗口从 10 万 token 扩展到百万级,叠加 agent 类工作负载中多轮串行调用带来的延迟叠加效应,使得“又快要又量大”成为常态需求。Gimlet 走的是异构硬件加软件调度的技术路线,本质上是在芯片供给有限的前提下,用架构匹配的方式把每度电的产出压到更高。多家芯片厂商如 Arm 的参与也表明,上游供应商对非英伟达单一生态的推理路径存在明确兴趣。
对用户/开发者/创作者的影响
对普通用户而言,这类推理基础设施优化最直接的体感是:同样的模型服务响应更快、单位时间内可处理的请求更多,价格有下调空间。对开发者来说,Gimlet 的多硅片推理云提供了另一种选择——如果其性能数据能在真实业务中复现,API 调用方将可以用同等预算获得更低的端到端延迟,这对构建多步骤 agent 或长上下文应用尤为关键。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业技术采购方而言,该模式意味着算力采购逻辑可能从“按 GPU 数量购买”转变为“按 token 吞吐和延迟指标购买”。不过目前 Gimlet 对外公开的信息仍以融资新闻和架构理念为主,尚无公开的客户案例或第三方基准测试报告可供验证,采购决策仍需谨慎对待其性能宣传。
值得关注的后续
第一,Gimlet 能否公开可复现的基准测试结果,并落地真实的规模化客户,这是验证“5-10 倍加速”是否成立的关键。第二,3 月至今该公司宣称已签下数十亿美元合同和吉瓦级数据中心合作项目,这些订单的具体形态与交付时间值得追踪。第三,在英伟达持续拉升 GPU 性能、同时云厂商也在自研推理芯片的竞争格局下,这家主打多芯片编排的公司能否形成可持续的生态壁垒,仍需持续观察。
来源:Hacker News


