快速结论:该报错通常出现在 vLLM 使用 ROCm 平台 + AITER FP8 MoE 后端运行 DeepSeek V3,并同时开启 TP8 + 数据并行注意力(DPA)时;优先排查是否使用了足够新的 vLLM ROCm nightly 镜像,旧版本中 AITER FP8 BMM 预编译内核可能触发段错误。
适用环境:vLLM(vllm-project/vllm);ROCm 平台;AMD MI350 / MI30 显卡;Python 3.12(来自日志中 dist-packages 路径);AITER FP8 MoE 后端;DeepSeek V3 模型(TP8 + DPA 场景)。
最快修复方案:升级到最新 vLLM ROCm nightly 镜像(Issue 中验证过的镜像 tag 为 vllm/vllm-openai-rocm:nightly-7c5dc571cbd1064ecc8a9b1045637ff647aa22cb),该版本已不再复现崩溃。
注意事项:此修复方案仅在 Issue 讨论者实测的 nightly 镜像上得到验证;如果用户使用的镜像或版本与此不同,升级后的行为可能因环境差异而有所不同。
问题场景
用户尝试在 AMD MI350 上运行 DeepSeek V3,使用 TP8(Tensor Parallelism 8)并开启数据并行注意力(DPA)时,vLLM 进程直接发生段错误(segfault)。日志显示 AITER FP8 MoE 后端被选中,并且在 AITER Triton 预编译 fp8 BMM kernel 的过程中出现崩溃。
报错原文
[Bug][ROCm]: AITER FP8 BMM segfaults with data parallel attention
INFO:inference_testing.servers.docker_utils: (Worker_DP5 pid=7943) [aiter] import [module_aiter_core] under /usr/local/lib/python3.12/dist-packages/aiter/jit/module_aiter_core.so
INFO:inference_testing.servers.docker_utils: (Worker_DP0 pid=7162) INFO 08-11 21:45:37 [fp8.py:325] Using AITER Fp8 MoE backend out of potential backends: ['AITER', 'FLASHINFER_TRTLLM', 'FLASHINFER_CUTLASS', 'DEEPGEMM', 'VLLM_CUTLASS', 'TRITON', 'MARLIN', 'HUMMING', 'BATCHED_DEEPGEMM', 'BATCHED_VLLM_CUTLASS', 'BATCHED_TRITON', 'XPU', 'CPU', 'HPC']
[Worker_DP0 pid=7162] INFO 08-11 21:45:39 [fp8.py:713] Using MoEPrepareAndFinalizeNaiveDPEPModular
[Aiter Triton] Pre-compiling fp8 BMM kernel: 100%|██████████| 1024/1024 [00:02<00:00, 484.86it/s]
[Aiter Triton] Pre-compiling fp8 BMM kernel: 100%|██████████| 1024/1024 [00:00<00:00, 13635.08it/s]
原因分析
根据 Issue 的讨论链,问题可能出在旧版本 vLLM ROCm nightly 镜像中的 AITER FP8 BMM 内核预编译过程。维护者未能在“当前 nightly 镜像”上复现此问题,所有 fp8 BMM 内核均能干净编译,因此问题大约率是特定旧版本镜像中的 AITER 集成缺陷,且仅在使用数据并行注意力(DPA)组合 TP8 的场景下被触发。由于问题报告者最初未提供 rocminfo | grep gfx 的 GPU 架构信息,无法确定是否与特定 GFX 架构强相关。
环境排查
- 确认 vLLM 安装方式(Docker 镜像 tag / pip 安装 / 源码构建),本 Issue 验证场景为
vllm/vllm-openai-rocm:nightly-7c5dc571cbd1064ecc8a9b1045637ff647aa22cb。 - 确认 Python 版本(日志显示为 Python 3.12);如使用 Docker,镜像内 Python 版本应与日志一致。
- 确认 ROCm 环境版本及驱动(日志中 AITER core 模块加载自
/usr/local/lib/python3.12/dist-packages/aiter/jit/module_aiter_core.so)。 - 确认 GPU 型号及 GFX 架构(运行
rocminfo | grep gfx),Issue 中提及 MI350 和 MI30,但初始未能复现时已补充说明 MI30 也正常。 - 确认是否启用了数据并行注意力(DPA)及 TP 大小(TP8)。
解决步骤
- 升级 vLLM ROCm 镜像(可优先尝试):将镜像升级到 Issue 中验证通过的 nightly 版本
vllm/vllm-openai-rocm:nightly-7c5dc571cbd1064ecc8a9b1045637ff647aa22cb或更新版本,然后重新启动推理服务。 - 确认是否仍需复现:如果必须固定使用旧镜像,尝试将启动参数中的数据并行注意力(DPA)关闭,或改用除
AITER之外的其他 FP8 MoE 后端(如FLASHINFER_CUTLASS、DEEPGEMM等,来自日志中列出的候选后端),观察是否能绕过崩溃。 - 收集完整环境信息:若问题仍在最新 nightly 镜像上出现,请执行
rocminfo | grep gfx获取 GPU 架构,并提供完整启动命令和最小复现脚本(当前 Issue 报告者未补充这些信息)。
验证方法
使用新镜像重新启动同一 DeepSeek V3 服务(TP8 + DPA),确认不再出现段错误。更严格的验证是在新镜像下观察 AITER Triton fp8 BMM kernel 预编译阶段是否 100% 完成且无进程退出。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


