[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs

用户在 Nvidia Blackwell B300 上使用 vLLM v0.25.0 部署 Qwen3.6-35B-A3B-NVFP4 模型,当并发请求数超过 8 时,生成吞吐量降至 0.0 tokens/s,容器需要重启。旧版镜像 0.19.2rc1.dev134+gfe9c3d6c5 表现正常。

[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs

[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs

快速结论:该问题发生在 vLLM v0.25.0 推理 Qwen3.6-35B-A3B-NVFP4 模型时,表现为相比旧版镜像(如 0.19.2rc1)端到端速度下降 2-3 倍,且并发超过 8 时可能无响应。优先尝试设置 --gdn-prefill-backend triton 或升级到包含 flashinfer 0.6.14 的 nightly 版本。

问题场景

用户在 Nvidia Blackwell B300 上使用 vLLM v0.25.0 部署 Qwen3.6-35B-A3B-NVFP4 模型,当并发请求数超过 8 时,生成吞吐量降至 0.0 tokens/s,容器需要重启。旧版镜像 0.19.2rc1.dev134+gfe9c3d6c5 表现正常。

报错原文

INFO 07-15 11:37:26 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 6 reqs, Waiting: 0 reqs

原因分析

可能原因:vLLM v0.25.0 的默认 prefill 后端(flashinfer)在特定输入形状下导致 kernel 挂起,尤其是当并发达到 8 左右时。用户尝试切换 attention 后端(--gdn-prefill-backend triton)后问题缓解,但 flashinfer 本身仍可能在某些形状下 hang。升级到包含 flashinfer 0.6.14 的 nightly 版本可彻底修复此问题。

环境排查

  • vLLM 版本:v0.25.0(新)、0.19.2rc1.dev134+gfe9c3d6c5(旧)
  • GPU 型号:Nvidia Blackwell B300
  • 模型:Qwen3.6-35B-A3B-NVFP4
  • 运行配置:--tensor-parallel-size 1--kv-cache-dtype fp8--max-model-len 256000--enable-prefix-caching

解决步骤

  1. 尝试设置环境变量或启动参数:--gdn-prefill-backend triton,强制使用 Triton prefill 后端以绕过 flashinfer 的潜在问题。
  2. 如果问题依然存在,检查 flashinfer 版本。若低于 0.6.14,升级到 vLLM nightly 版本(包含 flashinfer 0.6.14)或手动升级 flashinfer。
  3. 可优先尝试上述两个步骤,无需修改其他配置(如 --async-scheduling--max-num-batched-tokens 等保持原样)。

验证方法

使用相同并发请求(8+)进行压测,观察日志中的 Avg generation throughput 是否持续为 0.0 tokens/s 或恢复到旧版性能水平。另外可监控 GPU 是否有空闲(如 nvidia-smi)和容器是否保持响应。

参考来源

vllm-project/vllm #48718

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 14357

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注