三款AI推理芯片+超节点异构集群,云天励飞公布未来算力蓝图

云天励飞在2026 WAIC上公布了三款分工明确的AI推理芯片路线图,通过将大模型推理中的Prefill、Decode和Decode FFN环节拆分解耦,并配套万卡级异构集群和软件栈,目标是持续降低Token生成成本,走向“百亿Token一分钱”。

三款AI推理芯片+超节点异构集群,云天励飞公布未来算力蓝图

一句话看懂:云天励飞在2026 WAIC上公布了三款分工明确的AI推理芯片路线图,通过将大模型推理中的Prefill、Decode和Decode FFN环节拆分解耦,并配套万卡级异构集群和软件栈,目标是持续降低Token生成成本,走向“百亿Token一分钱”。

事件核心:发生了什么

7月18日,云天励飞在2026世界人工智能大会(WAIC)上公布了未来两年的AI推理芯片规划,计划推出三款云端大算力推理芯片:DeepVerse100P、DeepVerse100D和DeepVerse100L。每款芯片分别针对大模型推理中不同阶段的负载特征进行专用优化——DeepVerse100P面向百万级上下文的Prefill(预填充)场景;DeepVerse100D为Decode(逐Token生成)环节打造,拥有数倍于主流芯片的内存带宽并支持1024卡Scale-up及光互联;DeepVerse100L针对Decode阶段中计算密集型的FFN(前馈神经网络)部分,采用3D Memory架构。三款芯片将协同部署于万卡规模的异构集群中,通过高速互联形成分离式算力资源池。同时,云天励飞正在建设IFWA软件栈,兼容PyTorch、vLLM、SGLang等主流框架,并已开源Houmao多Agent异构编程框架,降低模型在DeepVerse平台上的适配与部署成本。此外,云天励飞还联合30余家单位启动了“1001计划”,旨在联动产业链上下游,共同优化Token生成效率。

为什么重要

当前大模型推理负载持续分化,对话、深度推理和实时Agent系统对计算、访存和延迟的要求截然不同。传统通用芯片在混部架构下,Prefill与Decode等不同环节会争夺算力和带宽资源,造成效率损失和尾延迟。云天励飞的方案并非追求单芯片算力峰值,而是从系统级角度,通过芯片专用化与集群协同,把优化重心从“单卡性能”转向“Token产出效率”。这种做法直接对标了大规模推理部署中成本与吞吐的瓶颈。如果三款芯片按计划落地,将意味着国产AI算力在推理领域从“通用追赶”转向“专用解耦+集群优化”的技术路线,可能改变推理芯片市场的竞争逻辑。同时,IFWA软件栈对主流框架的兼容和自动化工具链的引入,也降低了开发者从已有模型生态迁移的障碍,有助于扩大国产算力的实用基础。

对用户/开发者/创作者的影响

对企业采购与开发者:如果三款芯片实现预期性能,进行大规模AI推理部署的企业(如云服务商、AI应用开发公司)将可能获得更低的Token生成成本与更高的吞吐稳定性。开发者可以通过兼容PyTorch、vLLM等常见框架,将模型迁移到DeepVerse平台,而无需重复适配底层算子。开源的多Agent编程框架(Houmao)和Triton算子融入FlagOS,也减少了开发者在新芯片上做性能优化的重复劳动。对应用创作者:随着单位Token成本持续下降,依赖大量推理计算的新应用(如实时多Agent协同、长上下文Agentic Coding、高质量内容生成)的商业可行性有望提升。不过,这些影响取决于芯片的实际量产时间、集群部署的成熟度以及生态建设的进展。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 芯片量产与落地时间表:云天励飞公布了路线图,但未透露每款芯片的具体流片或量产时间,后续是否能按2026-2027年的节奏交付,将直接决定该计划的产业影响力。2. 异构集群的实际性能数据:三款芯片在万卡集群中的实际吞吐、延迟和能效数据尚未公开,后续发布的基准测试结果将是验证其设计思路的关键。3. 生态建设与竞品跟进:IFWA软件栈对主流开源框架的兼容程度以及“1001计划”的合作深度,将影响开发者迁移的意愿。同时,国内外主流芯片厂商是否也会推出针对推理环节解耦的专用芯片,值得持续观察。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 14523

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注