SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持

月之暗面发布首个开源3万亿参数级别模型Kimi K3(2.8T参数),推理引擎SGLang和训练框架Miles在发布当天即提供完整支持,通过混合注意力架构、高性能解码和并行策略,在单个GPU上实现超过420 tok/s的推理速度,并为RL训练提供了从43.3%到76.7%的AIME-2024分数提升。

一句话看懂:月之暗面发布首个开源3万亿参数级别模型Kimi K3(2.8T参数),推理引擎SGLang和训练框架Miles在发布当天即提供完整支持,通过混合注意力架构、高性能解码和并行策略,在单个GPU上实现超过420 tok/s的推理速度,并为RL训练提供了从43.3%到76.7%的AIME-2024分数提升。

事件核心:发生了什么

7月27日,LMSYS(Chatbot Arena团队)发布博客,宣布与月之暗面和NVIDIA合作,在SGLang和Miles中实现了对Kimi K3模型的“Day-0”支持。K3是首个公开的3万亿参数规模开源模型,拥有2.8T参数、1M token上下文窗口,并原生支持视觉理解。其架构与主流模型差异显著:采用69层KDA线性注意力与24层MLA交替的混合注意力,引入LatentMoE(896专家,top-16,在3584维潜空间运行)和Attention Residuals机制。SGLang团队针对KDA状态“原地覆写”的特性,重构了内存管理(包括无竞态状态迁移、前缀缓存、统一内存池),并实现了分阶段的并行策略(chunked pipeline parallelism用于prefill,context parallelism用于decode),配合DSpark推测解码(绑定专为K3训练的草稿模型),在batch 1下达到约113 tok/s(无推测)和约423 tok/s(带推测)。Miles框架则支持在原生MXFP4检查点上进行LoRA强化学习训练,12小时内将AIME-2024数学成绩从43.3%提升至76.7%。

为什么重要

K3的架构打破了当前主流推理栈(如纯MLA或GQA)的假设,其混合注意力、潜空间MoE、注意力残差等设计对显存管理、算子优化和并行策略提出了全新挑战。SGLang和Miles能在发布当天就提供完整支持,证明开源推理和训练框架能够快速适应超大规模、非标准模型,降低了行业采用新架构的门槛。同时,K3作为3万亿参数开源模型,直接挑战了闭源巨头的参数规模优势,可能加速开源社区在长上下文、多模态和性价比上的竞争。月之暗面选择开源并联合NVIDIA推动生态支持,也意味着其商业化策略更侧重技术影响力而非独家闭源。

对用户/开发者/创作者的影响

对AI应用开发者而言,K3的1M token上下文和原生视觉理解能力,结合开源推理引擎SGLang的实时支持,意味着可以直接在本地或自建服务上部署超长文档分析、多模态问答等场景,无需依赖闭源API。对AI研究人员和训练工程师,Miles框架提供了在MXFP4低精度基座上直接进行LoRA RL训练的路径,训练成本有望显著降低(12小时内完成AIME从43%到76%的提升,速度可观)。对内容创作者,如果未来K3被集成到工具中,可直接处理整本书、大型代码库或数小时的视频内容,而无需分段处理。需要留意的是,2.8T参数模型即使在推理优化后,单GPU仍无法运行完整模型,实际部署需要多GPU甚至节点级并行。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. K3模型本身的开源时间表及具体许可证尚未在博文中提及,需关注月之暗面的正式发布渠道;2. SGLang和Miles的支持代码已公开在GitHub仓库中,社区可尝试复现性能数据,关注实际部署成本与硬件需求;3. 其他推理框架(如vLLM、TensorRT-LLM)是否会跟进类似K3混合架构的适配,将决定该模型生态的扩展速度。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 15416

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注