GLM 4.7 Flash Crippled Today (6/3/2026)

用户在 Ollama 0.30.4 中运行 glm-4.7-flash 模型(Windows/AMD、Linux/Docker/AMD 双环境均复现),用于本地 agent 任务(Hermes agent、OpenCode 开发),出现离谱幻觉与工具调用损坏。同一模型在 0.24.0 下正常。

GLM 4.7 Flash Crippled Today (6/3/2026)

GLM 4.7 Flash Crippled Today (6/3/2026)

快速结论:Ollama 0.30.4 中 GLM 4.7 Flash 模型输出混乱、工具调用错乱、计数失败,回滚到 0.24.0 可恢复,且官方已重新推送修复后的模型。优先尝试 `ollama pull glm-4.7-flash` 重新拉取模型,或者暂时回退到 Ollama 0.24.0。

问题场景

用户在 Ollama 0.30.4 中运行 glm-4.7-flash 模型(Windows/AMD、Linux/Docker/AMD 双环境均复现),用于本地 agent 任务(Hermes agent、OpenCode 开发),出现离谱幻觉与工具调用损坏。同一模型在 0.24.0 下正常。

报错原文

# 计数测试对比

## 0.24.0(正常输出)
$ ollama run glm-4.7-flash count to 10
1, 2, 3, 4, 5, 6, 7, 8, 9, 10

## 0.30.4(异常输出)
$ ollama run glm-4.7-flash count to 10
  
 One Two,

 Three Four 
   +_FIVE!

Six (Seven) {Eight} [Nine] 

# 工具调用异常示例
- config.json 变成 config.json#session-multi-json-893y48761123
- 工具调用结果频繁在调用前突然截断
- 模型坚持探索不存在的目录(Firefox Developer Edition AppData)
- 计数输出:1, 6, 4, 1, 2, 6, 4, 1, 1, 2

原因分析

Ollama 官方开发者确认是由模型库中缺少参数导致的。具体来说,Ollama 在 0.30.x 版本引入了某些变化,导致模型的 GGUF 元数据中部分关键推理参数丢失(通过 diff 对比正常与异常版本的 ollama show --modelfile 发现,异常版本缺少以下参数):
PARAMETER top_p 0.95
PARAMETER min_p 0.01
PARAMETER repeat_penalty 1

这些参数缺失后,模型生成行为变得随机且不可控。此问题也可能与 llama.cpp 底层引擎的某些版本变更相关(参考 ggml-org/llama.cpp #23574),但 Ollama 方面未明确确认关联。

环境排查

  • Ollama 版本:确认是否为 0.30.0 或 0.30.4(版本 < 0.24.0 均可能受影响,但 0.24.0 正常)
  • 模型版本:使用 ollama list 确认 glm-4.7-flash 是否仍为旧版
  • 参数设置:运行 ollama show --modelfile glm-4.7-flash 检查是否包含 top_pmin_prepeat_penalty 参数
  • 上下文窗口:在长时间 agent 会话(约 65k token)时是否出现响应截断或停止

解决步骤

  1. 重新拉取模型(开发者已修复,可优先尝试):
    运行 ollama pull glm-4.7-flash 获取包含缺失参数的更新版模型。
  2. 验证参数是否补全:
    ollama show --modelfile glm-4.7-flash 应看到以下三行:
    PARAMETER top_p 0.95
    PARAMETER min_p 0.01
    PARAMETER repeat_penalty 1
  3. 如果仍存在问题(特别是大上下文场景):
    回退至 Ollama 0.24.0 临时规避:
    – 下载旧版 release 包(https://github.com/ollama/ollama/releases/tag/v0.24.0)
    – 卸载当前版后安装 0.24.0,再运行 ollama pull glm-4.7-flash
  4. 手动设置参数(备选方案):
    如果需要使用高版本 Ollama,可在 Modelfile 中手动补充缺失参数:
    FROM glm-4.7-flash
    PARAMETER top_p 0.95
    PARAMETER min_p 0.01
    PARAMETER repeat_penalty 1
    然后 ollama create glm-4.7-flash-fixed -f ./Modelfile

验证方法

运行以下测试确认修复是否成功:

  • 计数测试:ollama run glm-4.7-flash count to 10 应稳定输出 1, 2, 3, 4, 5, 6, 7, 8, 9, 10
  • 工具调用测试:在 agent 框架(如 OpenCode)中执行文件读取操作,确认返回值不再出现乱码后缀
  • 一致性测试:重复运行相同 prompt 3-5 次,观察输出是否稳定而非随机
  • 长上下文测试(可选):在接近 65k token 的会话中继续对话,确认模型不会突然停止响应

参考来源

ollama/ollama #16497 – GLM 4.7 Flash Crippled Today (6/3/2026)

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 14823

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注