不抢最贵GPU,专捡“没人要”的算力:前英伟达工程师搞出一套“拾荒者”打法

前英伟达工程师 Neil Movva 创立 Sail Research,不去抢最贵的 GPU,而是专门采购闲置算力、接受更低可用率,用“算力拾荒者”策略把 Token 成本压到全行业最低,并已获得 8000 万美元融资。

一句话看懂:前英伟达工程师 Neil Movva 创立 Sail Research,不去抢最贵的 GPU,而是专门采购闲置算力、接受更低可用率,用“算力拾荒者”策略把 Token 成本压到全行业最低,并已获得 8000 万美元融资。

事件核心:发生了什么

由前英伟达深度学习架构工程师 Neil Movva 与 Stanford 同学 Samir Menon 联合创立的 Sail Research,在 2026 年 6 月披露了累计 8000 万美元的种子轮和 A 轮融资,估值达 4.5 亿美元。种子轮由红杉资本领投,A 轮由 Kleiner Perkins 领投,红点、Theory Ventures、CRV 等机构参投,Alphabet 董事长 John Hennessy、Intel CEO Lip-Bu Tan、Together AI 首席科学家 Tri Dao 也以个人身份投资。

Neil 曾在英伟达参与 Volta GPU 的深度学习架构与算子优化,其 BatchNorm 实现比公开版 cuDNN 快约 20%;随后在 Apple 负责低延迟推理,并成为 Together AI 最早的内核工程师之一。这次创业,他选择了一条与主流相反的技术路线:不为追求高端 GPU 和极高可用率,而是把 AMD、TPU、Trainium 等“别人不要的芯片”、零散电力甚至小型数据中心聚合起来,专门承接长时程后台 Agent 任务。

为什么重要

这套思路直接挑战了当前 AI 推理行业“低延迟优先”的默认假设。Neil 认为,长时程智能体(如深度研究、网络安全扫描)运行数小时甚至数天,每秒输出 10 个 Token 还是 100 个 Token 并不关键,关键是同样 1 美元能买到多少“智能”。他把可用率从 99.9% 降到 95% 甚至更低,换取大幅成本下降,实质是在重新定义 AI 推理的定价逻辑。

同时,他对英伟达商业策略的分析也提供了难得的行业观察:英伟达刻意不亲自下场做云服务,而是扶持 CoreWeave 等一批互相竞争的云厂商,即使某家客户未来转向 AMD 或自研芯片,其他客户也能迅速补位。这也解释了为什么头部算力资源越来越依赖“关系和信用”而非单纯出价。

对用户/开发者/创作者的影响

对开发者和企业用户来说,最直接的影响是后台 AI 任务的成本结构可能发生改变。深度研究、代码漏洞扫描、大规模数据分析这类需要长时间运行的 Agent 任务,未来可能以远低于当前 API 的价格提供。Neil 举例说,解决一个长时程任务的成本正在从数百万美元降至几千美元,未来可能降到几百甚至几十美元,这会直接影响企业采购 AI 服务的预算判断。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和普通用户而言,如果后台主动式智能体成为主流,产品形态会从“你提问、AI 回答”转向“AI 主动在后台完成工作”。比如未来的语音助手可以持续监测邮件、短信,在你打开手机时预测下一步需求;深度研究覆盖的资料来源可以从 100 个扩展到 1 万个。前提是 Token 成本足够低,用户才愿意在没有明确回报承诺时让 AI 主动消耗算力。

值得关注的后续

目前公开信息显示,Sail Research 的产品尚未大规模上线,几个观察点值得跟进:一是其“低可用率算力池”的实际部署是否真能在生产环境中支撑长时程任务,稳定性和故障恢复机制是否成熟;二是 AMD、TPU 等非英伟达芯片在推理场景的性价比能否随其方案落地而进一步验证,是否会带动更多推理服务商调整硬件采购策略;三是开源模型生态与后台 Agent 的绑定是否加深——Neil 明确表示开源模型的“主权属性”是客户选择托管服务的关键动因,这一判断如果成立,开源模型的市场份额可能继续扩大。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 21246

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注