一句话看懂:开源大模型推理框架 vLLM 发布 v0.28.0,包含 584 个提交,重点针对 Kimi-K3 和 DeepSeek V4 等前沿模型做了深度推理优化,并默认提高了单次批处理上限。对 AI 推理速度和成本敏感的开发者和企业,这属于值得跟进的基础设施级更新。
事件核心:发生了什么
8 月 26 日,vLLM 项目发布 v0.28.0 版本,距离上一版本积累了 584 个提交,来自 270 位贡献者,其中 76 位是新人。这次更新的核心是围绕两个具体模型展开的“性能攻坚”:一是针对 MoE 架构的 Kimi-K3,引入了 Decode Context Parallel(DCP)支持、融合 FlashKDA 内核、自适应投机令牌预算等多项优化,官方称内核级加速达到 1.5~3 倍,并通过共享专家分片使单卡显存占用减少约 17 GiB;二是让 DeepSeek V4 的稀疏 MLA 技术在普通解码、MTP 和 DSpark 投机解码场景下实现端到端可用,并补充了 AMD Quark NVFP4 格式支持。此外,vLLM 的 Model Runner V2 进一步成熟,加入 E/P/D 解耦、权重卸载与多层 MTP KV 缓存支持;KV 缓存分级卸载也首次支持磁盘作为二级存储。版本还提升了默认配置:max_num_batched_tokens 从 8192 提升至 16384,Blackwell 平台的 CUDA 图捕获上限提升到 1024。
为什么重要
vLLM 是目前部署开源大模型最常用的推理服务框架之一,其一举一动直接影响 AI 应用落地的推理吞吐与单位成本。这次更新的意义不仅在于适配了 Kimi-K3 和 DeepSeek V4 两款当前热门模型,更在于把投机解码、上下文并行、KV 缓存分级卸载等此前偏实验室的技术,整理成了可配置、可默认启用的能力。从行业角度看,稀疏注意力在 DeepSeek V4 中的端到端打通,加上 ROCm 平台对 Kimi-K3 的支持,意味着开源推理栈正在加速适配 AMD 硬件,为算力选择提供了更多可能性。默认批处理上限翻倍,也直接有利于高并发生产环境的吞吐表现。
对用户/开发者/创作者的影响
对于已经使用 vLLM 部署服务的开发者,升级后最直接的收益可能是单机吞吐量提升与显存占用下降,尤其是在服务 MoE 架构模型时。Kimi-K3 的显存节省和 DeepSeek V4 在 ROCm 上的支持,有助于降低 GPU 采购或云租用成本。但需要注意,本次更新包含破坏性变更:bitsandbytes(8bit 量化)支持已迁移为外置插件,Transformers 依赖升至 5.15.0,旧版 KV 缩放计算接口被移除。这意味着依赖旧量化流程或自定义注意力参数的项目,需要相应调整代码后再升级。对于普通创作者和调用 API 的第三方应用,本版本改动主要在服务端,面向终端的直接体验变化有限。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,Kimi-K3 与 DeepSeek V4 的优化多数仍依赖具体内核实现,后续可关注这些优化是否会向下兼容更早的 vLLM 版本。其次,vLLM 将 bitsandbytes 迁移至外置插件,是插件化趋势的信号,观察其生态是否能承接住原有量化用户。另外,随着 ROCm 在 v0.28.0 中的支持扩展,AMD 在推理市场的实际竞争力变化也值得持续跟踪。
来源:Hacker News


