DeepSeek-V4.1-Flash 上线 SiliconFlow,552B MoE 支持 1M 上下文

硅基流动(SiliconFlow)在 DeepSeek 发布当天就上线了 DeepSeek-V4.1-Flash,这是一款 552B 参数的 MoE 模型,支持原生视觉和 1M 上下文,并以约 8B/16B 的激活参数实现高吞吐推理。

一句话看懂:硅基流动(SiliconFlow)在 DeepSeek 发布当天就上线了 DeepSeek-V4.1-Flash,这是一款 552B 参数的 MoE 模型,支持原生视觉和 1M 上下文,并以约 8B/16B 的激活参数实现高吞吐推理。

事件核心:发生了什么

据硅基流动官方 X 账号信息,DeepSeek-V4.1-Flash 已在 SiliconFlow 平台上线,属于“Day 0”同步支持。模型采用 552B 参数的 MoE 架构,预填充阶段激活约 8B 参数,解码阶段激活约 16B 参数。它具备原生视觉能力、1M 上下文窗口,KV cache 占用相比 V4 Flash 缩小约 4 倍,并以 MIT 许可证开放。硅基流动强调该模型在其平台上已达到生产可用、高吞吐的推理状态。

为什么重要

这组参数组合透露出 MoE 大模型当前的一个明确方向:总参数继续做大,但单次推理只激活很小一部分,从而在算力成本和响应速度之间取得平衡。552B 的体量配上 8B/16B 的激活规模,意味着推理时的实际计算开销远低于同参数量的稠密模型,这对 API 服务商的吞吐和定价都有直接影响。1M 上下文和原生视觉的加入,则让模型能处理更长的文档、更复杂的多模态输入,而不再需要外挂视觉编码器。MIT 许可证在开源阵营中属于相对宽松的选择,有利于第三方集成和商业化落地。目前公开信息显示,这是硅基流动在模型发布节奏上的一次快速跟进,也反映出国内推理平台在上线速度上的竞争正在加剧。

对用户/开发者/创作者的影响

对开发者来说,最直接的变化是可以通过 SiliconFlow 的 API 调用一个支持长上下文和视觉输入的旗舰级模型,而不必自行部署 552B 规模的权重。1M 上下文适合代码库分析、长文档问答、多轮复杂 Agent 任务;原生视觉则让图像理解、图表解析、截图问答等场景可以走同一个接口。KV cache 缩小约 4 倍,意味着长上下文请求的显存压力下降,服务端更有可能维持稳定的吞吐和价格。对创作者和企业用户而言,MIT 许可和“生产可用”的定位,降低了在自有产品中集成该模型的法律与工程门槛。不过,实际效果仍取决于 SiliconFlow 上的定价、限流策略以及模型在具体任务上的表现,这些目前公开信息显示尚未完全披露。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 SiliconFlow 上该模型的具体定价和速率限制,这决定了它能否真正替代现有的中端模型。二是 DeepSeek 官方是否同步开源权重,以及社区能否在本地或第三方云上复现相近的推理效率。三是原生视觉与 1M 上下文在实际任务中的稳定性,尤其是长上下文下的延迟和成本表现。竞品方面,其他推理平台是否会跟进上线,以及同类 MoE 模型是否会以更激进的激活参数比例回应,值得持续观察。

来源:X:硅基流动 SiliconFlow (@SiliconFlowAI)

celebrityanime
celebrityanime
文章: 22689

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注