开源大模型格局重塑!小米 MiMo-V2.6-Pro 强势杀回 Code Arena 前十,性能直逼国际第一梯队

小米全模态旗舰模型 MiMo-V2.6-Pro 首次进入 Code Arena WebDev 总榜前十,在 MIT 许可的开源权重模型中位列前三,早期自动评测分数已接近 Claude Fable5(High)等国际第一梯队模型。

一句话看懂:小米全模态旗舰模型 MiMo-V2.6-Pro 首次进入 Code Arena WebDev 总榜前十,在 MIT 许可的开源权重模型中位列前三,早期自动评测分数已接近 Claude Fable5(High)等国际第一梯队模型。

事件核心:发生了什么

根据 Arena.ai 公布的最新评测数据,小米新发布的全模态旗舰模型 MiMo-V2.6-Pro 在 Code Arena 的 WebDev(Web 开发测试场)中首次亮相,即进入总榜前十,并在采用 MIT 许可的开源权重模型中排名前三。

具体分数方面,MiMo-V2.6-Pro 在早期自动评测(AutoEval)中拿到 1628 分,与 Claude Fable5(High)持平,略高于 Hy4-preview 的 1624 分。相比上一代 MiMo-V2.5-Pro 的 1475 分,单次迭代提升了 153 分。在开源权重模型横向对比中,它目前落后第二名 Qwen3.8Flash Next 约 7 分,落后榜首 Kimi K3Max 约 46 分。需要注意,该成绩来自基于人类偏好数据训练的奖励模型自动投票,后续会随真实人类投票数据积累而继续验证。

为什么重要

Code Arena 的排名长期被少数国际头部模型占据,一个国内厂商的新模型能首次进入总榜前十,说明开源权重模型与闭源第一梯队之间的差距正在被压缩。更关键的是,MiMo-V2.6-Pro 采用 MIT 许可,这意味着开发者在商用和二次分发上的限制较少,对企业选型和自建推理服务是实质性利好。

从技术路线看,小米此次分数跃升发生在强化学习和全模态方向,目前公开信息显示,这与其在训练和推理层面的持续投入有关。对行业而言,开源阵营又多了一个有竞争力的选项,Code Arena 这类公开评测也会继续成为各家模型迭代的参照系。

对用户/开发者/创作者的影响

对开发者来说,MIT 许可加接近头部的代码能力,意味着可以更低成本地接入 API 或本地部署,用于 Web 开发辅助、代码生成和自动化脚本等场景。对企业和团队采购而言,开源权重模型提供了闭源 API 之外的替代路径,尤其在数据合规和推理成本敏感的项目中值得评估。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和内容创作者,短期内更直接的变化可能体现在接入该模型的应用和工具上,例如代码助手、图像生成与多模态创作工具。不过目前评测集中在 WebDev,其他能力是否同样接近第一梯队,还需要更多实际使用反馈。

值得关注的后续

一是真实人类投票数据积累后,MiMo-V2.6-Pro 的排名是否稳定在前十;二是小米是否会开放 API、定价和部署方案,以及是否配套开发者生态支持;三是 Qwen、Kimi 等开源竞品以及闭源头部模型是否跟进迭代,进一步抬高 Code Arena 的分数门槛。

来源:AIbase

celebrityanime
celebrityanime
文章: 25993

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注