[v0.20.0] cp38-abi3 wheels contains cp312 bindings
![[v0.20.0] cp38-abi3 wheels contains cp312 bindings](https://www.chat-gpts.plus/wp-content/uploads/2026/09/41487-1b3c2932-768x403.jpg)
该报错发生在使用 vLLM 0.20.0 的 PyPI 预编译 wheel(标签为 cp38-abi3)时,包内实际捆绑了仅针对 Python 3.12 编译的 deep_gemm 扩展(cp312),导致在 Python 3.8–3.11 或 3.13–3.14 环境导入时可能失败。
![[v0.20.0] cp38-abi3 wheels contains cp312 bindings](https://www.chat-gpts.plus/wp-content/uploads/2026/09/41487-1b3c2932-768x403.jpg)
该报错发生在使用 vLLM 0.20.0 的 PyPI 预编译 wheel(标签为 cp38-abi3)时,包内实际捆绑了仅针对 Python 3.12 编译的 deep_gemm 扩展(cp312),导致在 Python 3.8–3.11 或 3.13–3.14 环境导入时可能失败。
![[Bug]: tool_choice="required" not enforced with Qwen3.8-Flash-Next when enable_thinking=false (streaming); xgrammar "Failed to advance FSM"](https://www.chat-gpts.plus/wp-content/uploads/2026/09/55552-a09a0a5f-768x403.jpg)
该报错通常出现在 vLLM 使用 Qwen3.8-Flash-Next 模型、关闭 thinking(enable_thinking=false)且开启流式输出时,tool_choice="required" 未被强制生效,导致模型返回纯文本而非工具调用;开启 thinking 并启用 MTP 时,

该问题发生在 Open WebUI 的笔记(Notes)功能中,当笔记内包含指向自身标题的锚点链接(例如目录)时,点击链接不会滚动到对应标题位置,而是新开一个浏览器标签页并停留在笔记顶部。优先排查方向是确认笔记编辑器中的标题是否带有可被识别的 id,以及链接的锚点格式是否与标题经过 slugify

该报错发生在外部预设模型(preset: true、connection_type: external)被误当作 Workspace Model 处理时。点击编辑按钮会跳转到 /workspace/models/edit 并请求 /api/v1/models/model,最终返回 404,界面显示误

这是 Ollama MLX runner 在 macOS 上的前缀缓存恢复缺陷,导致长上下文提示词每次冷启动后都会浪费 0–8191 个 token 的重预填充时间(实测 17–27 秒),且无法通过现有的 num_ctx 、 num_batch 、 OLLAMA_KV_CACHE_TYPE 等参数

该问题出现在 ComfyUI 对 MiniMax-H3 使用任何 denoise_mask(包括完全均匀的掩码)时,输出会出现规则的 16×16 像素网格伪影。这是由 #15375 引入的回归,可能原因是掩码被模型重复处理导致时间步长不一致,优先可尝试通过 ModelPatcher 禁用模型的掩码分

该报错通常出现在 MiniMax H3 模型启用官方核心节点「Model Sparse Attention」时,因显存分配超限导致 OOM,优先排查 ComfyUI 内置的 comfy-compiler 优化是否出错,可尝试以 --disable-comfy-compiler 参数启动验证。
![[RFC] RL CI Matrix for vLLM: Behavioral + Physical + Protocol Coverage](https://www.chat-gpts.plus/wp-content/uploads/2026/09/45585-41fefa5f-768x403.jpg)
这是 vLLM 项目的一份 RFC 提案,核心是建立 RL(强化学习)训练场景下的 CI 测试矩阵。该报错场景源于 vLLM 的 cumem 显存管理、调度器暂停/恢复及权重传输 HTTP 协议缺少自动化测试覆盖,导致多个生产环境 Bug 在合并后才暴露。优先排查方向是关注 #46438 中提到的
![[RFC]: Partial Cache Hits for Hybrid Models](https://www.chat-gpts.plus/wp-content/uploads/2026/09/45702-8c7caa82-768x403.jpg)
该 RFC 讨论的是 vLLM 在混合架构模型(Full Attention + Mamba)中,由于 Mamba 状态块大小过大导致前缀缓存命中粒度变粗的问题。优先排查方向并非“修复报错”,而是评估是否引入 hash_block_size 配置以实现部分缓存命中(Partial Cache Hit

该报错发生在 transformers 5.16.1 的 transformers chat 命令行工具解析生成参数(generate_flags)时,当参数缺少 = 会导致索引越界崩溃。优先检查传递给 transformers chat 的所有 --generate 参数是否都严格包含 键=值 格