MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

小米 MiMo-V2.6 系列的两个模型 Pro 和 Flash 同时进入 Agent Arena 榜单,Pro 位列开源模型第 5,Flash 第 9。相比上一代 MiMo-V2.5-Pro 的第 13 名,Pro 单次版本跃升了 9 个位次。

一句话看懂:小米 MiMo-V2.6 系列的两个模型 Pro 和 Flash 同时进入 Agent Arena 榜单,Pro 位列开源模型第 5,Flash 第 9。相比上一代 MiMo-V2.5-Pro 的第 13 名,Pro 单次版本跃升了 9 个位次。

事件核心:发生了什么

据 Arena.ai 在 X 上公布的信息,小米 MiMo 团队的 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 已正式接入 Agent Arena 评测。Pro 在 8100 多场真实 agentic 会话中录得 +3.17% 的净提升,在开源模型中排名第 5。作为对比,上一代 MiMo-V2.5-Pro 排在第 13 位,净表现为 -7.23%,本次相当于提升 10.4 个百分点。Pro 表现最强的细分信号是 Confirmed Success,即用户明确反馈任务成功完成,在该项上得分 +7.35%,位列开源模型第 2。

Flash 版本在 1.3 万多场真实会话中净表现为 -0.57%,排开源模型第 9。它的单任务中位成本为 0.04 美元,比 Pro 低 56%,并因此进入 Agent Arena 的帕累托前沿。这一系列最早于 9 月 21 日由小米 MiMo 官方账号预告发布,定位为全模态模型。

为什么重要

Agent Arena 与常见的静态 Benchmark 不同,它统计的是真实 agentic 任务中的表现,包括任务是否完成、用户是否确认成功等信号,更接近产品化落地场景。MiMo-V2.6-Pro 从上一代的负净提升转为正提升,说明小米在 agent 场景上的训练和调优取得了可量化的进展。

Flash 进入帕累托前沿则意味着在成本与效果之间存在一个可选的平衡点。对于需要大规模调用模型执行任务的团队来说,这种“低成本 + 可接受效果”的组合往往比单纯追求榜单排名更有商业价值。

对用户/开发者/创作者的影响

对开发者而言,Pro 在 Confirmed Success 上的高排名,说明它在需要明确完成结果的 agent 流程中相对可靠,适合用于任务编排、工具调用等场景。Flash 的低成本定位则适合高频、轻量、对单次成本敏感的 AI 应用,例如批量内容处理或客服自动化。两者形成分层,开发者可根据任务复杂度选择调用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和创作者来说,这两个模型目前主要通过 API 或集成到小米生态产品中体现价值,具体上线渠道和定价方案目前公开信息显示尚未完整披露,需要以官方后续说明为准。

值得关注的后续

一是 MiMo-V2.6 系列的实际调用价格和 API 开放节奏,这直接决定开发者是否愿意迁移。二是 Pro 的 Confirmed Success 优势能否在更多第三方评测中复现,避免单一榜单的偶然性。三是开源模型赛道的竞争是否跟进,其他厂商是否会在 agent 指标上加大投入。

来源:X:Arena (@arena)

celebrityanime
celebrityanime
文章: 26783

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注