Kimi K3 可与 Fable 竞争;Kimi K3 和 Fabel 均达 SoTA

Fireworks AI 发布了开源模型 Kimi K3 的实测数据,表明它在约 1000 个代理任务上与闭源顶尖模型 Fable 5 质量相当,但成本显著更低。更关键的是,这两种模型在不同任务类型上各有所长,通过任务级路由可以将整体表现推至超越单一模型的水平。

Kimi K3 可与 Fable 竞争;Kimi K3 和 Fabel 均达 SoTA

一句话看懂:Fireworks AI 发布了开源模型 Kimi K3 的实测数据,表明它在约 1000 个代理任务上与闭源顶尖模型 Fable 5 质量相当,但成本显著更低。更关键的是,这两种模型在不同任务类型上各有所长,通过任务级路由可以将整体表现推至超越单一模型的水平。

事件核心:发生了什么

Fireworks AI 在宣布 D 轮融资和 10 亿美元年化收入的同时,公布了一项对比测试。测试将 Kimi K3(开源)与 Fable 5(闭源)在约 1030 个真实代理循环任务上进行了同框架评估。结果发现:在 SWE 基准上,K3 得分 92.4%,Fable 为 92.6%,两者极度接近;在五项任务类别(SWE、多语言编程、长期终端任务、法律文本等)的综合对比中,双方互有胜负,但整体质量差距在几个百分点以内。然而,成本差异巨大——K3 的 Token 定价、提示缓存消耗和任务级算力需求使其整体费用远低于 Fable。例如在 SWE 上,K3 单任务平均使用 55 轮、1.3M Tokens,而 Fable 仅需 21 轮、130K Tokens,但 K3 通过缓存命中实现了更低的总体成本。研究还发现,若采用“先知路由”(Oracle routing),K3 会被选中处理 72-96% 的任务流量,意味着一个接近完美的路由器有可能实现——只需学会区分日常任务与真正的长尾前沿工作。

为什么重要

这项研究揭示了几个正在演变的行业趋势:第一,开源模型在高难度代理任务上已能与闭源前沿模型正面竞争,且成本更低,这动摇了“闭源绝对领先”的叙事。第二,单一模型不再是“最优解”——不同模型在不同问题领域(如符号数学、工具开发 vs. Web 可视化)中展现了专业分工,任务级路由策略有望成为新的标准实践,使整体智能超越任何单模型。第三,Fireworks AI 作为基础设施层公司,通过路由工具商业化了“模型混合”理念,这直接影响未来 API 定价模式和开发者选型策略。

对用户/开发者/创作者的影响

对于开发者,这意味着可以借助路由技术实现“一份预算,两份效果”——在关键任务上调用更昂贵的 Fable,在日常任务上使用 K3,从而降低推理成本并提升吞吐。对于团队或企业采购者,这可能意味着传统的“选择一家模型供应商”模式正在失效,混合路由方案将更经济且更灵活。对于火花的创作者(如基于代理的自动化工具),设计上应优先考虑多模型路由接口,而非绑定单一模型。不过,当前路由依赖于“任务分类”的精准度,真正产品化的、低延迟的智能路由器尚未商业落地,需要更多训练数据和实际性能测试。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Fireworks AI 是否会开源其路线上的路由算法或提供商用路由 API?这直接决定开发者能否低成本复用该策略。第二,Kimi K3 的开源许可证是否允许商业再分发和微调?若允许,可能吸引社区专门针对其短板领域(如多语言编程)进行优化。第三,其他模型厂商(如 OpenAI、Anthropic)是否会跟进推出“多模型路由”服务,或者通过价格调整来压缩 K3 的成本优势?目前公开信息显示,这些仍是 Fireworks 单方面评估,需等待独立第三方复现验证。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 14570

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注