vLLM v0.28.0

vLLM 新版本 v0.28.0 发布,但用户反馈显示近几个版本在 DeepSeek-V4-Flash 和 Gemma-4 等主流模型上频繁出现卡死与乱码输出,推理引擎的稳定性问题再度成为社区焦点。

一句话看懂:vLLM 新版本 v0.28.0 发布,但用户反馈显示近几个版本在 DeepSeek-V4-Flash 和 Gemma-4 等主流模型上频繁出现卡死与乱码输出,推理引擎的稳定性问题再度成为社区焦点。

事件核心:发生了什么

vLLM 团队发布了 v0.28.0 推理引擎版本。然而在 Hacker News 的讨论帖中,有用户详细记录了连续多个版本的稳定性问题:在 B300 上运行 DeepSeek-V4-Flash 时,v0.26 需要三个外部补丁才能运行;升级到 v0.27 后不再需要补丁,但输出会随机变成重复 token 的乱码。在 RTX 6000 工作站上运行 Gemma-4,进程会卡死并需要强制重启;在 4x RTX 6000 的高并发场景下,模型输出出现大段语义崩溃的文本,看起来像是模型试图结束思考却被卡在循环中。该用户推测每次发布都有“某些东西严重损坏”,并调侃称这可能与团队内部大量使用“vibe coding”有关。后续讨论中有人指出,部分问题的根因是补丁导致 KV cache 索引使用了过窄的变量类型,发生整型回绕。

为什么重要

vLLM 是目前 AI 推理领域使用最广泛的开源框架之一,大量企业、开发者和云服务商依赖它来部署开源大模型。如果连续多个版本在主流模型和主流硬件(B300、RTX 6000)上都出现“带病发布”的情况,直接影响的是整个开源推理生态的可信度。更值得关注的是,社区讨论中提到的“模型自己发现输出异常”的现象——LLM 在推理循环中意识到输出偏离意图,这侧面反映出模型本身具备一定的自监控能力,但同时也暴露出推理引擎与模型协作时的脆弱性。对于依赖快速跟进新模型版本的团队来说,这种稳定性波动意味着每一次升级都可能是一次需要回归测试的风险操作。

对用户/开发者/创作者的影响

对于使用 vLLM 部署模型的开发者而言,这次讨论的实操价值在于:不要盲目追新版本。尤其是在生产环境,升级前建议先对目标模型和硬件组合做一轮完整的 E2E 测试,不能假设“官方发布即稳定”。文中用户提到使用 opencode/codex/claude 等测试框架做 A/B 部署可以提前发现大部分问题,这也是目前社区实践中的一个可行路径。对于创作者或企业方,如果底层推理框架出现乱码输出,直接影响是内容的可用性和可靠性,因此选择服务商时,除了看模型效果,也要关注其推理栈的版本管理能力。目前公开信息显示,vLLM 团队尚未对这批反馈给出官方正式回应,具体在 v0.28.0 中是否完全修复了上述问题,仍需要开发者自行验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

接下来可以观察三个方向:第一,vLLM 团队是否会针对 KV cache 整型回绕这类低层 bug 建立更严格的回归测试机制,特别是在多 GPU 高并发场景下;第二,社区是否会形成更成熟的“推理框架发布前验证清单”,类似于文中所提到的 A/B 测试流程;第三,像 DeepSeek-V4-Flash 这类新模型快速迭代时,开源推理框架的跟进速度与质量之间如何平衡——如果稳定性问题持续出现,可能会让更多企业转向托管式的闭源推理服务,这将在一定程度上影响开源推理生态的商业吸引力。

来源:hackernews

celebrityanime
celebrityanime
文章: 21358

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注