[Bug][ROCm]: AITER FP8 BMM segfaults with data parallel attention
![[Bug][ROCm]: AITER FP8 BMM segfaults with data parallel attention](https://www.chat-gpts.plus/wp-content/uploads/2026/09/51957-868e46e8-768x403.jpg)
该报错通常出现在 vLLM 使用 ROCm 平台 + AITER FP8 MoE 后端运行 DeepSeek V3,并同时开启 TP8 + 数据并行注意力(DPA)时;优先排查是否使用了足够新的 vLLM ROCm nightly 镜像,旧版本中 AITER FP8 BMM 预编译内核可能触发段错误
![[Bug][ROCm]: AITER FP8 BMM segfaults with data parallel attention](https://www.chat-gpts.plus/wp-content/uploads/2026/09/51957-868e46e8-768x403.jpg)
该报错通常出现在 vLLM 使用 ROCm 平台 + AITER FP8 MoE 后端运行 DeepSeek V3,并同时开启 TP8 + 数据并行注意力(DPA)时;优先排查是否使用了足够新的 vLLM ROCm nightly 镜像,旧版本中 AITER FP8 BMM 预编译内核可能触发段错误

该报错通常出现在启用 Rust 前端( VLLM_USE_RUST_FRONTEND=1 )的 vLLM 0.22.0 环境中,优先排查 Rust 前端子进程自身的启动日志,以及当前版本是否包含已知的 Rust 前端兼容性问题。

该报错通常出现在启用 Rust 前端( VLLM_USE_RUST_FRONTEND=1 )的 vLLM 0.22.0 环境中,优先排查 Rust 前端子进程自身的启动日志,以及当前版本是否包含已知的 Rust 前端兼容性问题。

该问题发生在 LangChain 文档中缺少对 langchain-truthbear 第三方集成包的收录列表。优先排查方向是确认该包在 PyPI 上的发布状态,并按外部工具集成(external tool integration)的方式提交文档 PR。

在 NVIDIA B200(SM100)上使用 FineGrainedFP8 模型(如 Qwen/Qwen3-4B-FP8)时,DeepGEMM 的 SM100 内核路径会静默返回错误结果。优先设置环境变量 TRANSFORMERS_DISABLE_DEEPGEMM_LINEAR=1 回退到 Tri

该问题发生在加载 google/gemma-4-E4B-it 模型时,模型内部的 per-layer embedding(PLE)表占用大量显存。优先排查方向是:在 from_pretrained 时是否使用了细粒度(per-module)的 device_map 字典,而不是只把顶层模块指定为 "

这个报错发生在 Transformers 的 MTP(Multi-Token Prediction)生成测试中:`test_generate_with_mtp` 会因为正则匹配错误跳过除 Inkling 外的所有模型,同时直接构造 `MtpModel` 时默认 `logits_processor=N

该问题发生在 Ollama 从旧版升级到 0.7.1 之后,AMD RX 7600 XT(gfx1102)显卡不再被用于推理,模型被强制跑在 CPU 上。优先排查 Ollama 自带的 ROCm 后端库(libggml-rocm 相关 .so 文件)是否随更新被覆盖或未安装。

Ollama Cloud 付费用户在使用云模型(如 deepseek-v4-pro:cloud)进行长耗时推理时,会在约 182 秒处被服务端强制断开连接。优先确认是否所有云模型请求均在相同时间点失败,因为这是服务端硬超时,客户端无法绕过。
![[bug]: InvokeAI v6.14.0-RC1 Crashed while generating Krea-2 Image](https://www.chat-gpts.plus/wp-content/uploads/2026/09/9444-d6bdc60c-768x403.jpg)
该问题发生在 InvokeAI v6.14.0-RC1 生成 Krea-2 图像时,主要表现为崩溃或输出异常。优先排查并避免使用 int8 量化模型,可尝试切换到 fp8 或 bf16 模型,并手动输入更高的分辨率(如 2MP)以规避滑块上限问题。