一句话看懂:7月28日,海光信息宣布其DCU国产GPU成功适配月之暗面Kimi K3万亿参数大模型,支持896个专家并行推理且性能稳定,性能损失控制在12%以内,达到商业部署门槛。这是国产算力首次独立支撑万亿级MoE模型,意味着开发者不再受限于海外高端芯片即可部署此类大模型。
事件核心:发生了什么
海光信息已完成DCU平台对Kimi K3的全栈适配与性能验证。Kimi K3基于MoE架构,内置896个专家模块并采用KDA注意力机制。海光从底层算子到推理引擎进行了定制优化,确保模型代码无需修改即可直接运行。在超过百万token的上下文场景中,896个专家并行推理仍能保持高效稳定。此前,月之暗面已与海光信息、中国科学院深圳先进院、南方科技大学合作,在DCU硬件栈上完成了Kimi MoE架构的分布式训练和多卡并行推理链优化,并基于8000集群实现了稳定长文本推理。官方测试数据显示,国产DCU相比海外旗舰芯片的性能损失控制在12%以内。
为什么重要
万亿参数大模型的训练与推理长期依赖英伟达等海外高端芯片,国产GPU因算力、生态或兼容性不足而难以规模化部署。海光DCU此次适配Kimi K3,证明了国产算力在核心性能损耗可控前提下,已具备支撑前沿大模型工业级部署的能力。MoE架构中专家并发是推理瓶颈,海光能在896专家规模下保持不卡顿,说明其异构计算与算子级优化取得了实质性突破。这对AI算力自主可控具有标志意义——当海外供应链不确定时,国内企业和研究机构有了可替代的国产硬件方案。
对用户/开发者/创作者的影响
对开发者而言,Kimi K3模型代码在DCU上无修改即可运行,迁移成本极低;获得国产算力资源的团队可直接部署万亿参数模型,用于开发长程智能体项目、视觉闭环创作等高级应用。对创作者来说,基于开源大模型的自研工具(如芯片设计辅助)有了可信任的国产算力底座。企业采购时,DCU的性能与成本验证为国产GPU作为替代选项提供了商业可行性依据。普通用户短期内感知较弱,但底层算力扩容有望降低模型服务成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
1)Kimi K3开源模型是否正式发布并提供DCU一键部署方案;2)其他国产GPU厂商(如华为昇腾、寒武纪)是否会快速跟进类似规模级大模型的适配;3)海光DCU在更大规模


