一句话看懂:vLLM 官方博客称,通过 SWA 有界重放与内核融合等系统优化,DeepSeek-V4.1-Flash 在 SemiAnalysis AgentX 智能体基准上吞吐提升 5.3 倍,低并发速度提升 1.9 倍。
事件核心:发生了什么
2026 年 10 月 7 日,vLLM 官方博客发布技术解读,介绍 DeepSeek-V4.1-Flash 发布三周内,Inferact 与 vLLM 社区对该模型进行的推理优化。核心数据是:低并发下速度提升 1.9 倍,在 150 TPS 约束下吞吐提升 5.3 倍。
优化分为两类。一是 SWA 有界重放:模型保留全局 KV(FP4,约 890 字节/token)和滑动窗口 KV(FP8,最后 128 位置)。vLLM 选择不缓存 SWA KV,而是在缓存命中时重跑最后 128 个 token 重建;解码端则对长提示只运行第 20 层生成全局 KV,第 21—39 层仅处理最后 128 个 token。配合可中断的 PIECEWISE CUDA graph,预填充计算时间减少 30%—40%。
二是内核优化:集成 DeepSeek 新发布的 MegaAttention、Mega-mHC、Mega-Gate、DeepSelect 等内核,并对剩余内核进行激进融合与并行化。SWA 有界重放默认开启,可通过 –[no-]swa-bounded-replay 控制。
为什么重要
长周期智能体服务对推理成本极其敏感。DeepSeek-V4.1-Flash 采用因果编码器-解码器架构,解码时每 token 激活 16B 参数,预填充仅 8B,本身已偏向推理效率。vLLM 的系统层优化进一步表明:模型架构与推理引擎协同设计,可以在不改变模型权重的前提下,把智能体场景的吞吐推到新的量级。
对开源推理生态而言,这意味着社区可以围绕新模型快速形成优化合力,而不是等待闭源 API 自行降价。目前公开信息显示,vLLM 公布的是基准测试结果,并非所有生产环境都能复现同等倍数,实际收益会取决于并发、提示长度和硬件配置。
对用户/开发者/创作者的影响
开发者若通过 vLLM 部署 DeepSeek-V4.1-Flash,长提示与多轮智能体任务的预填充延迟有望明显下降,单位算力可服务更多并发请求。使用 API 的开发者虽不直接接触这些内核,但推理效率提升通常会逐步传导至服务价格和响应速度。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
内容创作者和 AI 应用团队可关注的是:更便宜的智能体推理意味着长流程任务,如多步检索、代码生成、自动化操作,可能变得更具可行性。但精度方面,SWA 有界重放并非逐位精确;vLLM 称在 GSM8K 和 GPQA 上未观察到有意义差异,差距约在 1.5 个标准误以内。这仍属于特定基准结论,不宜直接外推到所有任务。
值得关注的后续
第一,这些优化是否进入 vLLM 稳定版本,以及非 DeepSeek 模型能否复用同类内核。第二,DeepSeek 官方是否披露更多架构细节和独立评测,验证长上下文与工具调用场景的精度。第三,云服务商和推理平台是否跟进降价或推出针对 AgentX 类负载的托管方案。


