JetBrains开源12B MoE模型Mellum2.1,强化编程Agent能力

JetBrains 于 2026 年 10 月 8 日发布并开源 Mellum2.1,这是一个总参数 12B、每 token 仅激活 2.5B 的 MoE 推理模型,专门面向编程 Agent 和快速子 Agent,在代码生成与仓库级任务上较前代大幅提升,同时主打可私有化部署。

一句话看懂:JetBrains 于 2026 年 10 月 8 日发布并开源 Mellum2.1,这是一个总参数 12B、每 token 仅激活 2.5B 的 MoE 推理模型,专门面向编程 Agent 和快速子 Agent,在代码生成与仓库级任务上较前代大幅提升,同时主打可私有化部署。

事件核心:发生了什么

JetBrains 在 Hugging Face 上以 Apache 2.0 协议发布了 Mellum2.1-12B-A2.5B-Thinking,即 Mellum2 Thinking 的升级版。模型保持与 Mellum2 相同的架构:28 层、64 专家、每 token 激活 8 专家,上下文长度 131,072 tokens,权重为 bfloat16。升级几乎全部来自后训练阶段的强化学习,训练环境涉及真实软件仓库、shell 和文件编辑工具,测试通过才获得奖励。官方公布的评测中,SWE-bench Verified 从 2.0 升至 47.0,SWE-bench Pro 从 0.0 升至 28.0,LiveCodeBench v6 达到 82.0,安全指标 HarmBench 从 21.5 降至 8.5。

为什么重要

Mellum2.1 的意义在于把“可自托管的编程 Agent 模型”推到了更实用的区间。12B 总量、2.5B 激活参数意味着推理成本较低,适合在单张 H200 或消费级硬件上通过 vLLM、SGLang 或 GGUF 运行,这对关注数据隐私和算力预算的团队有吸引力。从竞争格局看,JetBrains 选择开源路线,直接对标 Qwen3.5-9B 和 Gemma 4 E4B。根据 JetBrains 自报数据,Mellum2.1 在 17 项基准中胜出 Mellum2 15 项,但与 Qwen3.5-9B 交手仅赢 5 项,尤其在 Terminal-Bench 2.1 和知识类任务上仍有差距。目前公开信息显示,这些评测均来自 JetBrains 自建 pipeline,且 Qwen 官方榜单与 JetBrains 复测结果存在差异,说明横向对比仍需谨慎。

对用户/开发者/创作者的影响

对开发者而言,Mellum2.1 提供了新的本地编程 Agent 选项。完整模型可通过 vLLM 部署,工具调用需启用对应解析器;GGUF 量化版本已经出现,其中 Q4_K_M 约 8.1 GB,MXFP4_MOE 约 7.0 GB,适合 llama.cpp、Ollama 和 LM Studio 用户尝试。对企业和创作者来说,Apache 2.0 协议允许私有化部署和二次开发,如果团队需要代码补全、仓库级修改或自动化测试,可以将其作为候选方案,但建议先在自有任务上验证,不要直接采信榜单排名。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,GGUF 仓库和 vLLM 的 MTP 投机解码头仍在推进中,实际推理速度和部署体验需要等工具链完善后再评估。第二,Mellum2.1 在硬核 Agent 任务上落后 Qwen3.5-9B,后续版本能否通过更多 RL 环境缩小差距值得观察。第三,JetBrains 是否会将其集成到自家 IDE 或推出配套 Agent 产品,将决定它在开发者工作流中的实际渗透速度。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 28487

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注