一句话看懂:2026年8月8日,一份综合Artificial Analysis、LiveBench、LMArena三榜的全球大模型排行引发讨论:Fable 5与Opus 5包揽前二,GPT-5.6 Sol仅列第三;GPT系列虽有多款进榜,但排名分散,说明模型竞争已从单点跑分转向Agent与任务场景综合能力。
事件核心:发生了什么
这份榜单由@NFT_Chen整理,排名权重为Artificial Analysis占40%、LiveBench占35%、LMArena占25%。前十名依次为:Fable 5(LB与Arena双第一)、Opus 5(AA第一)、GPT-5.6 Sol(AA第3、LB第2)、Qwen3.8 Max(三榜排名5/6/5)、Kimi K3、Muse Spark 1.2、GPT-5.6 Terra、Gemini 3.1 Pro、Grok 4.5、GPT-5.5。
值得注意的落差在于:GPT-5.6 Sol虽在AA和LB两项客观评测中表现靠前,但Arena用户投票仅列第15名;GPT-5.5的LB排第3,AA却只排第53。前十中有多款产品仍处于预览或追赶状态,例如Qwen3.8 Max是预览版且不支持多模态,Gemini 3.1 Pro仍是Preview版本,Muse Spark 1.2目前只能输出文本。
为什么重要
这个排名方式本身说明,行业不再用单一基准评判模型,而是把主观体验、竞技场投票和深度评测按比例叠加。更关键的是,榜单共同指向一个新的能力维度:长时Agent任务、多文件编程、工具调用、百万级上下文——前十名几乎没有靠“纯聊天”上榜的模型。
GPT系列从“霸榜”变成分散卡位(第3、第7、第10),反映出闭源头部厂商的优势正在被压缩。Anthropic系模型占据前二,国产模型Qwen和Kimi也进入前五,模型选型进入多强并列阶段。
对用户/开发者/创作者的影响
对普通用户



