一句话看懂:四款新模型在同一周发布,把“智能指数 vs 单任务成本”的帕累托前沿整体推高,并新增 11 个最优点;其中 Claude Opus 5.5 以 58 分刷新最高分,但单任务成本达 5.98 美元,而 GPT-6 Luna 用 0.068 美元做到 37 分。
事件核心:发生了什么
据 Artificial Analysis 发布的信息,MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 的集中上线,改变了其“智能指数 vs 单任务成本”的帕累托前沿。所谓帕累托前沿,是指在给定成本下没有其他模型能同时做到更便宜且更聪明的那些点。
这一轮共形成 11 个新前沿点,来源包括:GPT-6 Luna 贡献 5 个(对应不同推理强度设置)、GPT-6 Sol 1 个、MiMo-V2.6-Pro 1 个、Claude Opus 5.5 4 个。具体数据上,GPT-6 Luna(max)为 37 分、每任务 0.068 美元;MiMo-V2.6-Pro 为 46 分、0.13 美元;GPT-6 Sol(max)为 48 分、1.06 美元;Claude Opus 5.5(max 含 fallback)以 58 分成为当前最高分模型,每任务成本 5.98 美元。
为什么重要
前沿整体位移,说明竞争不再只是“谁的分数最高”,而是“在每一档预算上谁最划算”。这对闭源旗舰尤为关键:Claude Opus 5.5 拿下了分数上限,但 5.98 美元的单任务成本意味着它更适合高价值、低频次的复杂任务;GPT-6 Luna 和 MiMo-V2.6-Pro 则把可用智能压到了更低的成本区间。
另一个信号是“推理强度”正在成为产品分层手段。同一模型通过不同 reasoning effort 就能占据多个前沿点,说明厂商可以用同一套权重覆盖从低价批量调用到高价深度推理的完整需求,这会直接影响 API 定价和路由策略。
对用户/开发者/创作者的影响
对开发者来说,模型选型正从“挑最强”转向“按任务分层路由”:批量摘要、分类、简单生成可走低成本档,复杂推理、代码审查、长链路 Agent 再切到高分模型。MiMo-V2.6-Pro 在 46 分、0.13 美元的定位,可能成为中等复杂度任务的有力候选。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业和创作者,成本可预测性提高,但要留意“max 配置”和“fallback 机制”会显著抬高账单,评测分数与实际业务表现也未必一致,仍需用自己的数据做小规模验证。
值得关注的后续
一是这些模型在真实 API 场景下的稳定性与限速政策是否与评测一致;二是竞品是否在下一轮更新中推出更便宜的前沿点,尤其在中低端价位;三是“推理强度可调”是否会成为 API 的标配定价维度,以及开源模型能否在同一前沿上继续施压。


