国产 GPU 也能跑万亿大模型:海光 DCU 适配 Kimi K3,896 专家并行不卡顿

7月28日,海光信息宣布其DCU国产GPU成功适配月之暗面Kimi K3万亿参数大模型,支持896个专家并行推理且性能稳定,性能损失控制在12%以内,达到商业部署门槛。这是国产算力首次独立支撑万亿级MoE模型,意味着开发者不再受限于海外高端芯片即可部署此类大模型。

一句话看懂:7月28日,海光信息宣布其DCU国产GPU成功适配月之暗面Kimi K3万亿参数大模型,支持896个专家并行推理且性能稳定,性能损失控制在12%以内,达到商业部署门槛。这是国产算力首次独立支撑万亿级MoE模型,意味着开发者不再受限于海外高端芯片即可部署此类大模型。

事件核心:发生了什么

海光信息已完成DCU平台对Kimi K3的全栈适配与性能验证。Kimi K3基于MoE架构,内置896个专家模块并采用KDA注意力机制。海光从底层算子到推理引擎进行了定制优化,确保模型代码无需修改即可直接运行。在超过百万token的上下文场景中,896个专家并行推理仍能保持高效稳定。此前,月之暗面已与海光信息、中国科学院深圳先进院、南方科技大学合作,在DCU硬件栈上完成了Kimi MoE架构的分布式训练和多卡并行推理链优化,并基于8000集群实现了稳定长文本推理。官方测试数据显示,国产DCU相比海外旗舰芯片的性能损失控制在12%以内。

为什么重要

万亿参数大模型的训练与推理长期依赖英伟达等海外高端芯片,国产GPU因算力、生态或兼容性不足而难以规模化部署。海光DCU此次适配Kimi K3,证明了国产算力在核心性能损耗可控前提下,已具备支撑前沿大模型工业级部署的能力。MoE架构中专家并发是推理瓶颈,海光能在896专家规模下保持不卡顿,说明其异构计算与算子级优化取得了实质性突破。这对AI算力自主可控具有标志意义——当海外供应链不确定时,国内企业和研究机构有了可替代的国产硬件方案。

对用户/开发者/创作者的影响

对开发者而言,Kimi K3模型代码在DCU上无修改即可运行,迁移成本极低;获得国产算力资源的团队可直接部署万亿参数模型,用于开发长程智能体项目、视觉闭环创作等高级应用。对创作者来说,基于开源大模型的自研工具(如芯片设计辅助)有了可信任的国产算力底座。企业采购时,DCU的性能与成本验证为国产GPU作为替代选项提供了商业可行性依据。普通用户短期内感知较弱,但底层算力扩容有望降低模型服务成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1)Kimi K3开源模型是否正式发布并提供DCU一键部署方案;2)其他国产GPU厂商(如华为昇腾、寒武纪)是否会快速跟进类似规模级大模型的适配;3)海光DCU在更大规模

celebrityanime
celebrityanime
文章: 15547

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注