一句话看懂:华为公布 Ascend 960 系列路线图,计划用超大规模集群和升级版 UnifiedBus 互联,支撑高达 10 万亿参数的大模型,在单卡性能受限的情况下以”堆规模+提通信”的方式对标 Nvidia。
事件核心:发生了什么
根据 TechRadar 报道,华为正扩展 Ascend 平台。Atlas 960 SuperPoD 最多可搭载 15,488 颗 Ascend 960 处理器,高于此前 8,192 颗的配置,整体提供 30 EFLOPS FP8 算力、60 EFLOPS FP4 算力,内存容量 4,460 TB,互联带宽 34 PB/s,训练性能预期达到每秒 1,590 万 tokens。
其中 Atlas 960E 是较有代表性的一档:最多连接 4,096 颗 NPU,通过 UnifiedBus 让这些芯片访问共享内存,FP8 算力 8 EFLOPS,号称支持 10 万亿参数级模型。华为把 UnifiedBus 与 Hi-ONE 光互连、近封装光学(NPO)结合,960E 只需约 5,500 个 Hi-ONE 单元,替代约 48,000 个传统 800G 光模块,据称可减少 550 千瓦以上功耗。960E 还能进一步组成 512,000 颗 NPU 的 SuperCluster。芯片节奏上,960DT 计划 2027 年一季度、960PR 计划三季度推出,华为称进度快于原计划,2028、2029 年将分别推出 Ascend 970 和 980。
为什么重要
单颗加速器性能受制于制造和供应链约束时,华为选择的是系统工程路线:既然单卡拼不过,就把几千颗芯片用高速互联拧成一台”大机器”。UnifiedBus 的意义正在于此——训练和推理时数千颗芯片要持续交换数据,通信瓶颈不解决,堆再多算力也发挥不出来。这套打法反映出一个现实:在 Nvidia 生态和先进制程受限的情况下,中国 AI 算力的竞争焦点正从单卡峰值转向集群效率、光互连和内存共享。目前公开信息显示,其性能数字多为华为自述,实际训练效率仍有待第三方验证。
对用户/开发者/创作者的影响
对国内开发者和企业采购方来说,可预期的变化是大模型训练与推理的国产算力供给可能进一步扩大,尤其是需要超长上下文、超大参数的训练任务。但真正决定迁移成本的是软件栈:CANN、MindSpore 与主流 PyTorch 生态的兼容程度、算子覆盖和调试工具是否成熟,比峰值算力更影响日常开发。对使用 Ascend 云服务的团队,值得提前关注 Atlas 960E 何时上线,以及 API 计费和资源调度方式是否变化。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 2027 年 960DT 和 960PR 能否按计划量产交付,而非停留在路线图;二是 10 万亿参数、1,590 万 tokens/s 等指标是否有独立测试或客户案例佐证;三是 UnifiedBus 与 Hi-ONE 光互连能否吸引更多框架和模型厂商适配,形成可持续的开源或闭源生态。
来源:TechRadar


