快速结论:该报错通常发生在 Blackwell 架构(SM120)GPU 上启动 vLLM 并启用 FlashInfer sampler 时,根因是系统 CUDA 环境与 Python 环境内 CUDA 工具链版本不一致(混用 12.8 与 13.x 组件),导致 FlashInfer JIT 编译时头文件与编译器不兼容。优先检查并统一 CUDA 工具链各组件版本。
适用环境:NVIDIA RTX PRO 6000 Blackwell(SM120f / sm_120);Python 3.12;PyTorch 2.11.0+cu130;vLLM 0.22.1rc1.dev58 或 0.27.1;FlashInfer 0.6.12.dev20260602;CUDA 13.3 工具链环境(pip 安装的 nvidia/cu13 或 conda 环境内)。
最快修复方案:暂无确认的一步修复方案。但可优先尝试将 CUDA 编译器(nvcc)、CUDA runtime、cccl 等组件版本与 PyTorch 的 cu130 对齐(例如使用 CUDA 13.0.88/13.0.85 系列版本),并统一设置 CUDA_HOME、PATH、LD_LIBRARY_PATH、LIBRARY_PATH 指向 Python 环境内的 CUDA 13 路径,且确保没有混用系统 CUDA 12.8。
注意事项:仅将 CUDA_HOME 指向 pip 捆绑的 nvidia/cu13 的 nvcc 并不能解决问题,JIT 编译仍会因头文件不兼容而失败(有评论确认此现象)。禁用 FlashInfer sampler(VLLM_USE_FLASHINFER_SAMPLER=0)可绕过此问题,但会失去该采样器功能。若在编译期间遇到 RAM 内存不足(OOM),可通过减小 MAX_JOBS 环境变量来缓解。
问题场景
在 NVIDIA RTX PRO 6000 Blackwell(SM120f / sm_120)GPU 上启动 vLLM(例如使用 Qwen3.5 或 Qwen3.8-27B-FP8 模型),且 FlashInfer sampler 默认启用时,vLLM 在启动阶段的 sampler/profile 预热或 JIT 编译过程中触发错误。
报错原文
In file included from
/root/miniconda3/envs/verl/lib/python3.12/site-packages/flashinfer/data/cccl/libcudacxx/include/cuda/std/__cccl/extended_data_types.h:26,
...
/root/miniconda3/envs/verl/lib/python3.12/site-packages/flashinfer/data/cccl/libcudacxx/include/cuda/std/__cccl/cuda_toolkit.h:41:8:
error: #error "CUDA compiler and CUDA toolkit headers are incompatible, please check your include paths"
41 | # error "CUDA compiler and CUDA toolkit headers are incompatible, please check your include paths"
| ^~~~~
...
另有评论报告在 vLLM 0.27.1(CUDA 13 pip 安装,无系统工具链)上出现:
RuntimeError: Could not find nvcc and default cuda_home='/usr/local/cuda' doesn't exist`. Note that pointing `CUDA_HOME` at the pip-bundled `nvidia/cu13` nvcc is not a fix — the JIT then fails on the header incompatibility described here.
原因分析
根本原因是环境中存在多套 CUDA 安装(系统级与 Python/conda 环境级),且各 CUDA 工具链组件版本混用导致不一致。具体表现为:
- FlashInfer JIT 编译路径有时会错误地指向系统 CUDA(例如 /usr/local/cuda -> CUDA 12.8),而非 Python 环境内的 CUDA 13。
- CUDA Python 包内部组件版本不同步:例如 nvcc/cccl 为 13.3,而 CUDA runtime/headers 为 13.0(与 PyTorch cu130 匹配)。cccl 的 libcudacxx 头文件检测到编译器版本与头文件版本不匹配,从而抛出 #error 中止编译。
- Blackwell SM120 架构需要 CUDA >= 12.9,若错误使用 CUDA 12.8 会触发额外的 device capability 报错。
这不是 FlashInfer 本身的功能缺陷,而是本地 CUDA 环境配置问题。另有评论指出,在 pip 安装的 CUDA 13 环境中(无系统工具链),直接将 CUDA_HOME 指向 pip 捆绑的 nvidia/cu13 nvcc 并不能解决问题,JIT 仍会报头文件不兼容错误,但该评论未给出具体修复后的配置。
环境排查
- 确认显卡架构是否为 SM120f / sm_120(Blackwell)。
- 列出系统中所有 CUDA 安装路径:系统级 /usr/local/cuda、conda 环境内 nvidia/cu13、pip 安装的 nvidia/cu13 等。
- 确认 CUDA_HOME、PATH、LD_LIBRARY_PATH、LIBRARY_PATH 当前指向哪个 CUDA 版本。
- 核对 PyTorch 对应的 CUDA 版本(torch.version.cuda),例如 cu130。
- 检查 Python 环境内各 CUDA 组件版本是否一致:nvcc、CUDA runtime/crt、cccl、nvvm 版本号。
- 确认 FlashInfer 版本(0.6.12.dev20260602)及 FLASHINFER_CUDA_VERSION / FLASHINFER_CUDA_ARCH_LIST 输出。
解决步骤
- 可优先尝试:若当前不是实际使用多 CUDA 环境的场景,但遇到上述报错,可先临时禁用 FlashInfer sampler 绕过问题(已验证可行):设置环境变量
VLLM_USE_FLASHINFER_SAMPLER=0后重启 vLLM。若业务可以接受该采样器被禁用,此为最快绕过方案。 - 定位(Issue 作者确认的根因):检查是否存在多套 CUDA 安装。若存在,确认当前 shell/环境中 CUDA_HOME、PATH、LD_LIBRARY_PATH、LIBRARY_PATH 实际指向哪个路径,是否混入了系统 CUDA 12.8。
- 统一 CUDA 组件版本:将 CUDA 工具链各组件(nvcc、crt、nvvm、cccl)版本对齐到与 PyTorch cu130 匹配的 CUDA 13.0 系列。Issue 作者验证过的版本组合为
nvidia-cuda-nvcc==13.0.88、nvidia-cuda-crt==13.0.88、nvidia-nvvm==13.0.88、nvidia-cuda-cccl==13.0.85(使用 –force-reinstall –no-deps 重装)。 - 重新设置环境变量:在启动 vLLM 前,将 CUDA_HOME 指向 Python 环境内 CUDA 13 的实际路径(如 /root/miniconda3/envs/verl/lib/python3.12/site-packages/nvidia/cu13),并同步更新 PATH、LD_LIBRARY_PATH、LIBRARY_PATH,确保只使用该路径,不再混用系统 CUDA。
- 若遇到 RAM 内存不足:有评论反馈其报错实际源于 JIT 编译时的 RAM OOM,将 MAX_JOBS 调小即可解决;可将此作为附加排查项。
- 若已采用 CUDA 13 pip 安装且没有系统工具链:根据评论,仅设置 CUDA_HOME 指向 nvidia/cu13 无法解决此问题,需进一步排查版本对齐或依赖关系,当前 Issue 中未给出针对该场景的已验证修复方案。
验证方法
环境修正后,重新启动 vLLM(保持 FlashInfer sampler 默认启用),确认不再出现 #error "CUDA compiler and CUDA toolkit headers are incompatible 报错,vLLM 能完成启动,且能正常调用 /v1/chat/completions 接口完成推理请求。也可在启动前运行 python -m flashinfer show-config,确认 NVCC、CUDA_VERSION、FLASHINFER_CUDA_VERSION、CUDA_HOME 指向和版本均与预期一致且无异常警告。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。

![[Bug]: GPT-OSS 20b/120b [backend_xgrammar.py:160] Failed to advance FSM for request](https://www.chat-gpts.plus/wp-content/uploads/2026/08/22513-df0a6a4c-768x403.jpg)
