RuntimeError: Number of heads in key and value must divide the number of heads in

这个报错通常出现在用 GlmConfig 手动构造 GLM 因果语言模型、且 num_attention_heads 无法被 num_key_value_heads 整除时(例如 7 对 2)。配置校验和模型构建都会通过,直到第一次 forward 才在注意力实现里抛出 RuntimeError:

这个报错通常出现在用 GlmConfig 手动构造 GLM 因果语言模型、且 num_attention_heads 无法被 num_key_value_heads 整除时(例如 7 对 2)。配置校验和模型构建都会通过,直到第一次 forward 才在注意力实现里抛出 RuntimeError:

这个报错通常出现在把 BART 系列模型(如 facebook/bart-base)的注意力实现从默认的 SDPA 切换为 eager 之后,eager_attention_forward 直接把 2D/不匹配的 attention_mask 加到注意力权重上导致形状不匹配或结果异常。优先排查当前

当使用 Ollama 调用 deepseek-r1:1.5b(或其它 DeepSeek-R1 量化模型)并请求 JSON 输出时,如果模型陷入重复生成、无法输出 EOS,会触发 token repeat limit,Ollama 就 不会回填 usage 字段 ,于是出现 usage 全为 0。优先

当 glm-ocr 或其它 OCR/文本补全模型输出的内容里含有大量连续重复 token(例如书籍习题里成排的句点“.”)时,Ollama 的“token repeat limit”循环检测会被误触发,提前中止生成并返回 "done": false 。优先排查模型输出中是否存在这类重复串,而不是先怀

这个报错通常出现在使用 OpenAI Python SDK 的异步流式结构化输出(如 client.beta.chat.completions.stream() )并叠加 Langfuse 等埋点/包装库时,包装层让 AsyncStream 的 .response 指回自身而不是底层的 httpx.

报错 “Pydantic and JSON schemas need upgrade” 通常出现在把 Pydantic 生成的 JSON Schema 与 OpenAI Python SDK / Responses API 的 Structured Outputs 对接时,尤其在 schema 嵌套

CrewAI CLI 1.15.6 的测试套件(`tests/test_create_crew.py`)出现 20 个测试失败,核心原因是生成的 `pyproject.toml` 中 `crewai[tools]` 依赖约束被写成了 `>=1.15.6,<2.0.0`,而测试断言期望的版本是 `1.
![[BUG] Task output schema in the prompt marks Optional fields as required and strips null, so the model cannot express "not applicable"](https://www.chat-gpts.plus/wp-content/uploads/2026/09/6774-15a8d678-768x403.jpg)
这个报错通常出现在 CrewAI 使用 output_pydantic 定义任务输出、并在 prompt 内嵌 JSON Schema 时:prompt 里的 schema 把 Pydantic 模型中的 Optional 字段强行标成 required 且去掉 null ,导致模型无法表达“不适用

该问题通常出现在 Windows 上用一键安装脚本部署 TextGen WebUI 时,安装流程虽然没报错,但实际装成了 CPU 版 PyTorch,导致启动后无法调用 GPU。优先确认 PyTorch 是否为 CUDA 版、CUDA 是否真实可用,再考虑换用官方推荐的 WSL 安装方式。

这个报错通常出现在使用 numpy 1.* 并通过 llama.cpp 的 convert_hf_to_gguf.py 把较大模型转换为 Q8_0(以及 TQ1_0、TQ2_0)时,权重符号被静默破坏;优先检查 numpy 版本与 gguf/quants.py 中的 np_roundf 实现。