![[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48718-b3db3e4a.jpg)
[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs
快速结论:该问题发生在 vLLM v0.25.0 推理 Qwen3.6-35B-A3B-NVFP4 模型时,表现为相比旧版镜像(如 0.19.2rc1)端到端速度下降 2-3 倍,且并发超过 8 时可能无响应。优先尝试设置 --gdn-prefill-backend triton 或升级到包含 flashinfer 0.6.14 的 nightly 版本。
问题场景
用户在 Nvidia Blackwell B300 上使用 vLLM v0.25.0 部署 Qwen3.6-35B-A3B-NVFP4 模型,当并发请求数超过 8 时,生成吞吐量降至 0.0 tokens/s,容器需要重启。旧版镜像 0.19.2rc1.dev134+gfe9c3d6c5 表现正常。
报错原文
INFO 07-15 11:37:26 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 6 reqs, Waiting: 0 reqs
原因分析
可能原因:vLLM v0.25.0 的默认 prefill 后端(flashinfer)在特定输入形状下导致 kernel 挂起,尤其是当并发达到 8 左右时。用户尝试切换 attention 后端(--gdn-prefill-backend triton)后问题缓解,但 flashinfer 本身仍可能在某些形状下 hang。升级到包含 flashinfer 0.6.14 的 nightly 版本可彻底修复此问题。
环境排查
- vLLM 版本:v0.25.0(新)、0.19.2rc1.dev134+gfe9c3d6c5(旧)
- GPU 型号:Nvidia Blackwell B300
- 模型:Qwen3.6-35B-A3B-NVFP4
- 运行配置:
--tensor-parallel-size 1、--kv-cache-dtype fp8、--max-model-len 256000、--enable-prefix-caching
解决步骤
- 尝试设置环境变量或启动参数:
--gdn-prefill-backend triton,强制使用 Triton prefill 后端以绕过 flashinfer 的潜在问题。 - 如果问题依然存在,检查 flashinfer 版本。若低于 0.6.14,升级到 vLLM nightly 版本(包含 flashinfer 0.6.14)或手动升级 flashinfer。
- 可优先尝试上述两个步骤,无需修改其他配置(如
--async-scheduling、--max-num-batched-tokens等保持原样)。
验证方法
使用相同并发请求(8+)进行压测,观察日志中的 Avg generation throughput 是否持续为 0.0 tokens/s 或恢复到旧版性能水平。另外可监控 GPU 是否有空闲(如 nvidia-smi)和容器是否保持响应。



