gpt-oss:20b (MXFP4) deterministic llama-server abort in CUDA ADD_ID on a short two-message /api/chat (0.32.13 and 0.33.3)

在 NVIDIA RTX 4000 Ada(cc 8.9)上用 Ollama 运行 gpt-oss:20b (MXFP4)时,短的两条消息(system + user) /api/chat 请求会触发 CUDA 图计算中的 ADD_ID failed 断言并导致 llama-server 崩溃(co








