DeepSeek-V4.1-Flash上线千问AI平台,API与Token Plan同步开放

DeepSeek 的新轻量旗舰 DeepSeek-V4.1-Flash 已上线阿里千问 AI 平台,API 与 Token Plan 同步开放;它用 552B 总参数、约 8B 输入激活的 MoE 结构,把百万级上下文和长程 Agent 任务的成本压了下来。

一句话看懂:DeepSeek 的新轻量旗舰 DeepSeek-V4.1-Flash 已上线阿里千问 AI 平台,API 与 Token Plan 同步开放;它用 552B 总参数、约 8B 输入激活的 MoE 结构,把百万级上下文和长程 Agent 任务的成本压了下来。

事件核心:发生了什么

据 AIbase 报道,DeepSeek-V4.1-Flash 已在千问 AI 平台上线,开发者可通过标准 API 接入,也可在 Qoder、Qwen APP、Codex 等工具里直接使用 Token Plan,覆盖代码、文档、视觉理解和 Agent 任务。目前公开信息显示,该模型采用 MoE 架构,总参数 552B,使用 Causal-Encoder-Decoder 非对称结构,输入激活约 8B、输出激活约 16B,原生支持文本与图像理解,最大上下文 100 万 tokens,最大输出约 393K。官方称其在多个 Agent 与代码基准上较上一代有明显提升,同时保持较高吞吐和较低延迟。

为什么重要

这次发布的关键不在单点参数,而在“大参数、小激活、强缓存”的组合。新一代缓存压缩把 KV Cache 对 HBM 的需求降到上一代的四分之一,SSD 存储需求降到八分之一,为长上下文和多轮工具调用省出资源。价格上,千问页面给出分时定价:低峰输入 1 元/百万 tokens、输出 4 元;高峰分别为 2 元和 8 元,限速 15K RPM、1M TPM。对 DeepSeek 来说,进入千问生态意味着多了一个重要的分发渠道;对阿里云来说,则补强了百炼平台上的第三方模型供给。

对用户/开发者/创作者的影响

开发者最直接的收益是长文档解析、客服知识库、代码仓库问答、多模态订单审核这类任务可以收敛到单一接口。阿里云百炼已与 vLLM 开源社区完成适配,中国站和国际站均可访问,覆盖北京、新加坡,以及美国、德国、日本、香港等区域。功能上支持多轮对话、函数调用、联网搜索、上下文缓存和结构化输出,max_tokens 上限约 393,216。小团队可以用低峰价格配合 Token Plan 订阅,做批量推理和原型验证,试错成本比过去更低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是分时定价能否稳定,低峰窗口是否会被实际负载挤占;二是百万上下文在真实 Agent 链路里的缓存命中率和稳定性,需要第三方实测;三是千问平台引入 DeepSeek 模型后,与其他闭源、开源模型的组合策略会如何调整,是否会带动更多第三方模型入驻。

来源:AIbase

celebrityanime
celebrityanime
文章: 23352

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注