Modal 详解如何以万亿 token 规模服务 Kimi K2.6 编码 Agent 推理

Modal 官方工程博客披露,他们为 Moonshot AI 的 Kimi K2.6 编码 Agent 搭建的推理服务,在单副本上把单用户性能提升 2.8 倍、整体吞吐提升 5.6 倍,并把这套方案扩展到日均处理数百亿、累计数万亿 token 的规模。这给高成本的大模型推理服务如何做到可商用,提供了一份可复用…

一句话看懂:Modal 官方工程博客披露,他们为 Moonshot AI 的 Kimi K2.6 编码 Agent 搭建的推理服务,在单副本上把单用户性能提升 2.8 倍、整体吞吐提升 5.6 倍,并把这套方案扩展到日均处理数百亿、累计数万亿 token 的规模。这给高成本的大模型推理服务如何做到可商用,提供了一份可复用的工程样本。

事件核心:发生了什么

Modal 在 9 月 23 日发布工程博客,复盘了为 Kimi K2.6 编码 Agent 提供推理服务的优化过程。文章给出的关键数据是:通过优化,单个推理副本的每用户解码速度(交互性)提升 2.8 倍,副本整体 token 吞吐提升 5.6 倍。Modal 将优化后的副本扩展为服务,其中一个服务每天处理数百亿 token,累计处理量达到万亿级。用户可以通过 OpenRouter、Vercel AI Gateway 等推理路由平台间接使用,也可以直接调用 Modal 的 Shared Endpoints 或 Dedicated Endpoint。Modal 同时指出,K2.6 已不算新模型,但序列建模、硬件和扩展的基本规律变化较慢,因此这套经验对更新的 Kimi K3 等模型依然适用。

为什么重要

编码 Agent 的推理服务有两个硬约束:相对性能要高,即尽可能接近硬件峰值;绝对规模要大,因为万亿参数模型每服务一个请求都要反复访问参数。这决定了它目前只有在万亿级 token 的规模上才能摊薄硬件和工程成本。Modal 公开这套做法,等于把“大模型推理能否赚钱”从模糊判断变成了具体的工程问题:吞吐、延迟、并发用户数和单 GPU 产出之间的取舍,以及如何把单容器副本扩展成多副本服务。对正在做 Agent 产品的公司来说,这是一份关于成本结构的参照。

对用户/开发者/创作者的影响

对开发者而言,直接价值在于推理部署路径更清晰:可以通过托管端点或路由平台接入编码 Agent,而不必自建万亿参数模型的推理集群。对使用编码 Agent 的团队,交互性和吞吐同时提升,意味着在同等预算下可以获得更快的响应,或在高并发场景下控制成本。对更广泛的 AI 应用开发者,文章提醒推理正在成为计算资源的主要消耗方向,模型选择之外,服务端的批处理、并发调度和显存管理同样决定产品体验和毛利。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Modal 是否会把这套优化能力产品化,比如公开更多 Dedicated Endpoint 的性能基准或定价细节;二是 OpenRouter、Vercel AI Gateway 等平台上的编码 Agent 推理延迟和价格是否随之变化;三是 Kimi K3 及其他万亿参数开源、闭源模型的服务成本能否沿同样路径继续下降。目前公开信息显示,这套经验主要来自 Modal 自身服务,其他厂商是否跟进类似工程披露,还有待观察。

来源:Modal 官方工程博客(RSS)

celebrityanime
celebrityanime
文章: 25274

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注