小米 MiMo-V2.6-Pro 登上 Code Arena: WebDev 榜约第10名,开源权重中约第3

小米 MiMo-V2.6-Pro 首次进入 Code Arena 的 WebDev 总榜前十(约第 10 名),在开源权重模型中排到约第 3,AutoEval 得分 1628 分,较上一代 MiMo-V2.5-Pro 提升 153 分。这意味着小米的大模型在代码与网页开发这类硬指标上,已经挤进全球第一梯队的边…

一句话看懂:小米 MiMo-V2.6-Pro 首次进入 Code Arena 的 WebDev 总榜前十(约第 10 名),在开源权重模型中排到约第 3,AutoEval 得分 1628 分,较上一代 MiMo-V2.5-Pro 提升 153 分。这意味着小米的大模型在代码与网页开发这类硬指标上,已经挤进全球第一梯队的边缘。

事件核心:发生了什么

据 Arena(@arena)发布的信息,小米 MiMo 团队的新模型 MiMo-V2.6-Pro 登上 Code Arena 的 WebDev 榜单,首次评测即位列总榜约第 10 名;在采用 MIT 许可证的开源权重模型中约排第 3。其 AutoEval 得分为 1628 分,与 Claude Fable 5(High)打平,略高于 Hy4-preview 的 1624 分。

与自家上一代 MiMo-V2.5-Pro 相比,这一分数从 1475 提升到 1628,涨幅达 153 分。在开源阵营内部,它距离第 2 名 Qwen3.8 Flash Next 仅差 7 分,距离第 1 名 Kimi K3 Max 差 46 分。小米同期还发布了 MiMo-V2.6 的 Pro 与 Flash 两个版本,并称 Pro 在多数 agent 基准上与 Claude Opus 5、GPT-5.6 Sol 表现相当。需要注意,Arena 明确说明当前是早期 AutoEval 分数,由基于人类偏好数据训练的奖励模型自动投票,而非实时人类投票。

为什么重要

第一,代码与 WebDev 能力是大模型商业化最直接的能力之一,涉及 IDE 插件、代码补全、自动化 agent 等真实付费场景,这个榜单的名次比通用聊天分数更能反映工程可用性。第二,小米以 MIT 许可证开放权重,属于宽松开源路线,允许商用和二次分发,这对希望自建推理、做私有化部署的团队吸引力明显。第三,从 1475 到 1628 的单代跃升,说明小米在多模态与强化学习训练上的投入正在转化为可量化结果,而不只是发布会话术。目前公开信息显示,中国厂商在开源代码模型这一细分赛道上已形成相当密集的第一梯队。

对用户/开发者/创作者的影响

对开发者而言,MIT 许可意味着可以较低合规成本把 MiMo-V2.6-Pro 接入自有产品或做微调,尤其适合需要本地推理、数据不出内网的场景;但 AutoEval 分数不等于真实体验,建议先用实际项目做小范围对照测试,再决定是否替换现有 API。对创业团队和企业采购来说,多一个高性能开源选项有助于压低推理成本、减少对单一闭源供应商的依赖。对内容创作者,模型能力提升主要体现在代码类教程、建站工具和自动化脚本的门槛下降,但图像生成等能力需以官方发布信息为准。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 AutoEval 分数在更多真实人类投票进入后会如何收敛,是否仍能守住前十。二是 MiMo-V2.6 Pro 和 Flash 的 API 定价、上下文长度与部署要求是否公开,决定其实际采用率。三是 Qwen、Kimi 等开源竞品是否跟进发布新版本,以及 Code Arena 榜单头部是否出现新一轮洗牌。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 24862

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注