RadixArk 与 Google Cloud 合作,将完整 SGLang 功能引入 TPU

RadixArk 与 Google Cloud 宣布合作,将开源推理框架 SGLang 的完整功能带到 Google TPU 上,开发者未来可像使用 GPU 一样,用同一套 API 在 TPU 上运行主流大模型,并有望实现新模型“GPU 发布当天即支持 TPU”。

一句话看懂:RadixArk 与 Google Cloud 宣布合作,将开源推理框架 SGLang 的完整功能带到 Google TPU 上,开发者未来可像使用 GPU 一样,用同一套 API 在 TPU 上运行主流大模型,并有望实现新模型“GPU 发布当天即支持 TPU”。

事件核心:发生了什么

2026 年 7 月 30 日,SGLang 项目维护方 RadixArk 与 Google Cloud 联合宣布,将把 SGLang 推理框架完整引入 Google TPU。SGLang 是一个面向生产级推理的开源框架,主打高吞吐和低延迟,目前已在全球数十万 GPU 上运行,每日生成数万亿 token,GitHub 获超过 3 万星标、1700 多名贡献者。

当前,开发者已可通过 SGL-JAX 在最新一代 TPU 上运行 SGLang,支持 Gemma、Qwen、DeepSeek、GLM、Mimo、Kimi、Ling、MiniMax、Grok 等大语言和多模态模型,以及 Wan、Flux 等视频和图像生成扩散模型。今年晚些时候,RadixArk 还将推出 SGL-torchtpu——一个基于 PyTorch 的原生 TPU 后端,支持 eager 执行、PyTorch 生态兼容及 MPMD(多程序多数据)模式,让研究者可借助标准 PyTorch 工具链,在 TPU 上运行 SGLang 服务的全尺寸开放模型。该后端将包含数据并行、张量并行、专家并行、上下文并行、流水线并行、Radix Cache、HiCache、量化、投机解码等特性,均基于 RadixArk、Google 及 SGLang 社区共同构建的 TPU Pallas 内核。

为什么重要

此次合作打破了 GPU 与 TPU 之间的算力壁垒。此前,SGLang 主要运行在 GPU 上,而 TPU 虽在特定场景下具备成本优势,但因软件生态差异导致开发者迁移成本高。RadixArk 与 Google 的合作使 TPU 成为 GPU 的“即插即用”替代方案——开发者无需修改 API 或推理逻辑,即可根据工作负载和性价比自由选择硬件。Google 工程副总裁 Bill Jia 表示,这是“可编程异构”愿景的关键一步,软件应成为开放桥梁而非锁定机制。对于云服务市场,这意味着 TPU 将不再仅仅是训练专用芯片,而是能灵活承接推理负载,可能重塑企业对算力供应商的选择依据。

对用户/开发者/创作者的影响

AI 研究人员和工程师:可直接用 PyTorch 工具链(SGL-torchtpu)在 TPU 上运行 LLM 推理,享受 SGLang 的全部高级功能(如 Radix Cache、投机解码),无需学习 JAX 或专门适配 TPU 内核。同时,Day 0 支持承诺意味着新开源模型发布当天即可在 TPU 上使用,显著降低硬件等待时间。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

企业 AI 应用开发者:可在同一套 SGLang API 下混合使用 GPU 和 TPU 集群,根据任务弹性和成本动态调度算力。TPU 在批量推理场景下通常更经济,有望降低推理总拥有成本。

内容创作者和模型用户:间接受益于更低的推理成本、更快的模型上线速度,尤其是视频生成等对算力敏感的扩散模型,可能因 TPU 成本优势而获得更便宜的服务。

值得关注的后续

  1. SGL-torchtpu 的落地时间与性能:目前公开信息显示该后端计划于 2026 年下半年推出,届时需关注其在实际多主机 TPU 上对全尺寸模型(如 DeepSeek、Gemma)的推理延迟、吞吐量以及与 GPU 版本的性能对比。
  2. 模型 Day 0 支持的可持续性:RadixArk 能否真的做到新开源模型“GPU 发布当天即支持 TPU”,取决于社区贡献和谷歌 TPU 内核更新速度,这将是衡量合作执行力的关键指标。
  3. 竞品与生态反应:英伟达 GPU 生态(如 TensorRT-LLM、vLLM)是否会通过优化来巩固推理市场?其他云厂商(AWS Trainium、Azure Maia)是否也会加速开源框架适配?这将影响 AI 推理基础设施的最终格局。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 16077

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注