Eval bug: Error on loading Gemma 4 family with the new updates

该报错发生在 llama.cpp 新版本中启用 MTP(Multi-Token Prediction)头部加载 Gemma 4、Qwen 等模型时,模型加载阶段因资源分配或参数断言失败而崩溃。优先排查 llama.cpp 构建版本是否包含修复提交 73159c3(PR #28183),并尝试更新到该

该报错发生在 llama.cpp 新版本中启用 MTP(Multi-Token Prediction)头部加载 Gemma 4、Qwen 等模型时,模型加载阶段因资源分配或参数断言失败而崩溃。优先排查 llama.cpp 构建版本是否包含修复提交 73159c3(PR #28183),并尝试更新到该

llama-server 在 token 生成(decode)阶段出现 CPU 占用高、GPU 占用低的现象,通常不是 bug,而是模型加上下文所需显存超出显卡 VRAM 容量,导致权重或 KV Cache 溢出到系统内存所致。优先排查启动日志中模型权重的加载位置,并尝试降低上下文长度(-c)使模型

这个报错通常发生在 Dify 1.17.0 升级后,模型插件无法加载、默认模型无法配置的场景,优先排查 plugin_daemon 镜像版本是否与 1.17.0 匹配(应为 langgenius/dify-plugin-daemon:0.6.10-local )。

这个报错通常出现在 Dify v1.17.0 自托管(Docker)环境中。Agent V2 编排面板(Orchestrate)中的“知识库(Knowledge Base)”配置选项被隐藏,是前端编译时功能开关 ENABLE_AGENT_KNOWLEDGE_RETRIEVAL 默认设为 false
![[Bug][DCP] NVIDIA DeepSeek-V3.2 / GLM-5.2 fused attention bypasses DCP handling](https://www.chat-gpts.plus/wp-content/uploads/2026/09/50095-245de1c7-768x403.jpg)
该报错发生在 vLLM 使用 NVIDIA DeepSeek-V3.2 或 GLM-5.2 模型并开启纯 DCP(Decode Context Parallelism,TP4+DCP4)时,fused attention 路径绕过 DCP 处理导致输出为重复乱码(如 locklocklock...

这个 bug 发生在 LangChain 的 AIMessage.content_blocks 属性被读取时,Anthropic、Bedrock、Google GenAI 和 Vertex AI 的翻译器会直接修改原始消息内容,导致数据静默丢失或增加。优先检查你使用的 provider 是否属于这四

该报错发生在 Transformers 库中 PPFormulaNet 模型训练时,原因是 ForCausalLMLoss 默认对 labels 左移一位,但 PPFormulaNet 是 encoder-decoder 架构,logits 与 labels 已对齐,导致训练标签错位、丢失最后一个目

该报错属于隐性问题,在使用 Transformers 加载 Qwen3-VL-MoE 旧版布局检查点时触发,当模型中间层维度恰好等于隐藏层维度或其二分之一时,专家权重会被静默转置加载,模型输出变成垃圾数据且不报任何警告。优先排查 moe_intermediate_size 与 hidden_size

该报错发生在 Langfuse 自托管部署中,当 Dashboard 图表使用按类型(usageType/costType)统计用量或成本的指标时,ClickHouse 查询因 ARRAY JOIN 与 SELECT/GROUP BY 中重复使用别名而失败。优先排查 Dashboard 中是否使用了

该报错通常出现在 Langfuse 自托管 server 3.225.5 搭配 ClickHouse 26.8+ 的环境下,新生成的 trace 写入 ClickHouse 成功但无法在 Observability → Tracing 界面显示。优先排查 ClickHouse 版本,并检查 `tra