在 Claude Code 中测试 Moonshot AI 的 Kimi K3

Moonshot AI 发布 2.8 万亿参数的 Kimi K3,称将是首个该规模的开源权重模型,实测在 Claude Code 工作流中表现接近顶级闭源模型,成本比 Claude Opus 4.8 低约 40%。开源大模型与闭源前沿的差距正在缩短到数月级别。

一句话看懂:Moonshot AI 发布 2.8 万亿参数的 Kimi K3,称将是首个该规模的开源权重模型,实测在 Claude Code 工作流中表现接近顶级闭源模型,成本比 Claude Opus 4.8 低约 40%。开源大模型与闭源前沿的差距正在缩短到数月级别。

事件核心:发生了什么

Moonshot AI 发布 Kimi K3,参数规模达 2.8 万亿,支持原生视觉和 100 万 token 上下文窗口。Moonshot 表示,模型权重将于 7 月 27 日前开放,并承认 K3 综合能力仍落后于 Fable 5 和 GPT-5.6 Sol,用户体验也未完全达到同等水平。

一位开发者将 Claude Code 作为前端,通过 OpenRouter 将请求路由至 Kimi K3 进行实测。结果显示:K3 实测输出速度约每秒 62 token,Claude Opus 4.8 约为每秒 57 token,K3 的首次响应时间更短。尽管初始感知偏慢,但一小时后已无明显体感差异。在前端生成任务中,K3 表现良好,目前其在 Code Arena 排行榜位列第一。

成本方面,该次实测共 115 个请求、1364 万 prompt token(其中 1295 万为缓存命中)和 8.2 万输出 token,总费用 7.18 美元。按 Anthropic 公开价格折算同等流量,Claude Opus 4.8 约 11.96 美元,Claude Fable 5 约 23.92 美元,K3 分别便宜约 40% 和 70%。

同期,阿里巴巴宣布了同样将开源权重的大模型 Qwen 3.8,Thinking Machines Lab 也发布了 9750 亿参数、410 亿激活参数的 Inkling 并开放完整权重。开源大模型的发布正在排队出现。

为什么重要

Kimi K3 的意义不在于单点超越,而在于它把开源模型与闭源前沿的差距压缩到了可被市场忽略的范围内。Epoch AI 估算,最佳开源权重模型落后闭源前沿仅数月。这意味着模型本身正在快速商品化:买家可以选择等待、切换或把负载分散到多家供应商。

开源权重还会对闭源 API 定价形成实际压力,即使大多数用户并不会自托管模型。价值正在从模型层向上游应用、下游芯片和推理基础设施转移。正如原文作者所言,真正的威胁不是 Kimi 成为第一,而是没有人能长时间保持第一。

对用户/开发者/创作者的影响

对成本敏感的 API 用户,K3 是一个值得测试的替代方案,实测显示其在前端生成和常规编码任务上表现接近 Opus 级别,价格有明显优势。但需要注意:K3 在复杂任务中更容易过度主动、对工具链更敏感,处理模糊需求时不如 Opus 可靠,关键业务场景建议保留闭源旗舰模型作为兜底。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者切换模型时,不能只看每百万 token 单价。不同模型对同一任务的 token 消耗差异可能很大,应以真实工作负载的总成本为准。同时,工具的校准和习惯养成也需要时间,短期内”感觉变慢”不一定代表真实性能下降。

对创作者而言,K3 的原生视觉能力和前端生成表现为图像到代码的工作流提供了新的低成本选项,但输出质量仍高度依赖 prompt 的具体程度,建议以实际项目验证后再决定是否替换现有工具。

值得关注的后续

第一,K3 权重是否按承诺于 7 月 27 日前开放,以及开源后社区微调版本能否在推理效率和专业任务上进一步逼近闭源模型。第二,阿里 Qwen 3.8 和其他中国厂商的开源节奏是否会加速,形成持续的开源大模型供给队列。第三,Claude 等闭源 API 是否会因开源压力调整定价或推出针对性的低成本档位,目前公开信息显示价格战已有加剧迹象。

来源:HN Algolia · AI 24h

celebrityanime
celebrityanime
文章: 18781

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注