
GLM 4.7 Flash Crippled Today (6/3/2026)
快速结论:Ollama 0.30.4 中 GLM 4.7 Flash 模型输出混乱、工具调用错乱、计数失败,回滚到 0.24.0 可恢复,且官方已重新推送修复后的模型。优先尝试 `ollama pull glm-4.7-flash` 重新拉取模型,或者暂时回退到 Ollama 0.24.0。
问题场景
用户在 Ollama 0.30.4 中运行 glm-4.7-flash 模型(Windows/AMD、Linux/Docker/AMD 双环境均复现),用于本地 agent 任务(Hermes agent、OpenCode 开发),出现离谱幻觉与工具调用损坏。同一模型在 0.24.0 下正常。
报错原文
# 计数测试对比
## 0.24.0(正常输出)
$ ollama run glm-4.7-flash count to 10
1, 2, 3, 4, 5, 6, 7, 8, 9, 10
## 0.30.4(异常输出)
$ ollama run glm-4.7-flash count to 10
One Two,
Three Four
+_FIVE!
Six (Seven) {Eight} [Nine]
# 工具调用异常示例
- config.json 变成 config.json#session-multi-json-893y48761123
- 工具调用结果频繁在调用前突然截断
- 模型坚持探索不存在的目录(Firefox Developer Edition AppData)
- 计数输出:1, 6, 4, 1, 2, 6, 4, 1, 1, 2
原因分析
Ollama 官方开发者确认是由模型库中缺少参数导致的。具体来说,Ollama 在 0.30.x 版本引入了某些变化,导致模型的 GGUF 元数据中部分关键推理参数丢失(通过 diff 对比正常与异常版本的 ollama show --modelfile 发现,异常版本缺少以下参数):
PARAMETER top_p 0.95
PARAMETER min_p 0.01
PARAMETER repeat_penalty 1
这些参数缺失后,模型生成行为变得随机且不可控。此问题也可能与 llama.cpp 底层引擎的某些版本变更相关(参考 ggml-org/llama.cpp #23574),但 Ollama 方面未明确确认关联。
环境排查
- Ollama 版本:确认是否为 0.30.0 或 0.30.4(版本 < 0.24.0 均可能受影响,但 0.24.0 正常)
- 模型版本:使用
ollama list确认glm-4.7-flash是否仍为旧版 - 参数设置:运行
ollama show --modelfile glm-4.7-flash检查是否包含top_p、min_p、repeat_penalty参数 - 上下文窗口:在长时间 agent 会话(约 65k token)时是否出现响应截断或停止
解决步骤
- 重新拉取模型(开发者已修复,可优先尝试):
运行ollama pull glm-4.7-flash获取包含缺失参数的更新版模型。 - 验证参数是否补全:
ollama show --modelfile glm-4.7-flash应看到以下三行:
PARAMETER top_p 0.95
PARAMETER min_p 0.01
PARAMETER repeat_penalty 1 - 如果仍存在问题(特别是大上下文场景):
回退至 Ollama 0.24.0 临时规避:
– 下载旧版 release 包(https://github.com/ollama/ollama/releases/tag/v0.24.0)
– 卸载当前版后安装 0.24.0,再运行ollama pull glm-4.7-flash - 手动设置参数(备选方案):
如果需要使用高版本 Ollama,可在 Modelfile 中手动补充缺失参数:
FROM glm-4.7-flash
PARAMETER top_p 0.95
PARAMETER min_p 0.01
PARAMETER repeat_penalty 1
然后ollama create glm-4.7-flash-fixed -f ./Modelfile
验证方法
运行以下测试确认修复是否成功:
- 计数测试:
ollama run glm-4.7-flash count to 10应稳定输出1, 2, 3, 4, 5, 6, 7, 8, 9, 10 - 工具调用测试:在 agent 框架(如 OpenCode)中执行文件读取操作,确认返回值不再出现乱码后缀
- 一致性测试:重复运行相同 prompt 3-5 次,观察输出是否稳定而非随机
- 长上下文测试(可选):在接近 65k token 的会话中继续对话,确认模型不会突然停止响应
参考来源
ollama/ollama #16497 – GLM 4.7 Flash Crippled Today (6/3/2026)



