一句话看懂:Prime Intellect 发布了 NanoGPT Speedrun 排行榜,通过让 20 款最新大模型各自运行 9 天编码智能体任务,量化它们逼近人类表现记录的速度。目前 Fable 5 以 81.7% 的差距闭合率位居榜首,而传统霸主 GPT-5.6 与 Claude Opus 5 仅位列中游。
事件核心:发生了什么
Prime Intellect 的研究项目 NanoGPT Speedrun 公布了一组横向评测数据,核心是衡量大模型在“智能体时间”内的表现——即模型作为编码智能体自主运行 9 天,能缩小多少与人类最佳记录之间的差距。评测以人类记录(2,600 分)为基准,基线(Baseline)为 3,290 分,共纳入 20 款模型。
排名第一的 Fable 5(配合 claude-code 工具链)在 8.7 天内将差距闭合率推进至 81.7%,刷新记录至 2,726 分。紧随其后的是 Opus 5(53.6%)和 Kimi K3 在 prime-agent 工具链下取得的 52.2%。值得注意的是,GPT-5.6 Sol(35.9%)仅列第六,GPT-5.6 Sol Pro(33.6%)第七,而 Qwen3.8 Max、DeepSeek V4 Pro 等开源系模型目前仍在运行中,成绩尚无定论。
数据还显示,所有模型的“@24H”成绩(运行 24 小时后的分数)均远低于最终成绩,说明长时间自主运行对最终表现贡献极大。整个榜单共开放了 41 条完整智能体轨迹,涵盖工具调用、子智能体与 scratchpad 记录。
为什么重要
这项评测的独特之处在于它测试的是大模型的“耐力型智能体能力”,而非单轮问答或代码生成的瞬时质量。传统基准如 HumanEval 或 SWE-bench 衡量的是模型单次输出的正确率,但 Speedrun 衡量的是模型在九天持续自主完成任务、自我纠错、动态规划的综合能力——这是 AI 从“工具”走向“同事”的关键指标。
排名结构本身也传递了重要信号:Fable 5 的登顶说明新模型正在打破 OpenAI 和 Anthropic 的双寡头叙事。Anthropic 的 Opus 5 虽然排名第二,但被运行成本更低、速度更快的 Kimi K3 紧咬。开源阵营的 Qwen3.8 Max 和 DeepSeek V4 Pro 在同等预算下甚至有追平闭源旗舰的趋势。另一个值得注意的细节是:同一模型搭配不同工具链(如 Kimi K3 搭配 prime-agent 与 kimi-code)成绩差距明显,提示“模型+智能体框架”的组合优化正在成为新的竞争维度。
对用户/开发者/创作者的影响
对开发者而言,这份榜单最直接的参考价值在于工具链选择。Kimi K3 用 prime-agent 比用自家 kimi-code 提升了 6.4 个百分点(52.2% vs 45.8%),说明第三方智能体框架在某些场景下比官方 CLI 更高效。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业采购方来说,运行 Tokens 消耗量是比较成本的关键指标:Fable 5 总 Tokens 消耗约 8 亿,而 GPT-5.6 Sol 消耗高达 29 亿 Tokens 却只取得第六名——同样的任务预算,不同模型的知识密度差异巨大。
对独立开发者与研究者而言,Prime Intellect 公开了完整轨迹数据是最大的红利。通过查看模型在 9 天内的每一步决策、工具调用与子智能体分工,可以更深入地理解大模型的长程推理模式,这比看任何技术报告都更直观。它也可以作为 Agent 工程教学的理想案例库。
值得关注的后续
目前最有价值的观察点是三方面。第一,还在运行中的 Qwen3.8 Max、DeepSeek V4 Pro 和 GLM 5.3 最终成绩如何——如果开源阵营能进入前五,将直接重写“开源弱于闭源”的市场认知。第二,榜单是否会引发其他厂商(尤其是 Google 的 Gemini 系列)跟进类似的长周期智能体测评,推动行业标准从“一次性测试”转向“持续工作能力”验证。第三,Fable 5 背后的模型团队是否会公开技术细节或开放 API——如果该模型保持闭源且价格较高,榜单的行业参考价值就会被削弱。


