`clef-flash` decision model always fails on `/v1/systemone` — “Clef: non-finite logit” (CUDA) / “Clef: cannot open model” (CPU)

该报错通常出现在 Windows 版 Ollama 调用 clef-flash (Q8_0、9.1B)的 /v1/systemone 决策端点时,模型在首次前向传播(prompt 处理)阶段就失败;优先确认是否为 Windows 构建的已知缺陷,并尝试改用 WSL2 / Linux 环境。

快速结论:该报错通常出现在 Windows 版 Ollama 调用 clef-flash(Q8_0、9.1B)的 /v1/systemone 决策端点时,模型在首次前向传播(prompt 处理)阶段就失败;优先确认是否为 Windows 构建的已知缺陷,并尝试改用 WSL2 / Linux 环境。

适用环境:Issue 中已确认的环境包括 Ollama 0.35.1、Windows 10.0.26300 / Windows 11 10.0.26300.9457 / Windows 10 Pro 10.0.19045、模型 clef-flash:latest(digest 2aa4d39fd93b,Q8_0,9.1B,base Qwen3.5 9B),后端涵盖 CUDA(RTX 4090 / 3080 Ti / 5070 Ti / 5080)、AMD ROCm、Vulkan、纯 CPU,以及官方 Linux 版 Ollama 在 WSL2 下。评论区还报告了无独显、启用 OLLAMA_IGPU_ENABLE=1 的场景。

最快修复方案:暂无确认的一步修复方案。Issue 中已验证可行的规避方式是在同一台机器上改用 WSL2 Ubuntu + 官方 Linux 版 Ollama(ollama-linux-amd64.tar.zst)运行,clef-flash 在该环境下可正常工作。

注意事项:该结论基于单一 Issue 讨论链中的用户验证,并非官方修复公告;重装 Ollama 0.35.1、重新 ollama pull 模型、强制 CPU、调整 num_ctx 均已被报告无效。不要据此断定模型文件损坏——相同 manifest 与 blob 在 WSL2 和 Mac 上均正常。

问题场景

用户在 Ollama 0.35.1(Windows)中拉取带 Clef 决策头的 clef-flash(Q8_0,9.1B),然后请求 /v1/systemone 决策端点。无论是文档中的最简示例,还是包含 noul、choice、score 多种问题的复杂请求,都会在 prompt 处理阶段直接返回 HTTP 500。相同的 clef-flash 模型在 /v1/chat/completions 上工作正常;同机上的 clef:27b(Q4_K_M)以及没有 Clef 决策头的模型(如 nimble、tev1:0.8b、tev1:4b)在 /v1/systemone 上也正常。

报错原文

{"error":{"code":500,"message":"Clef: non-finite logit","type":"server_error"}}

srv    send_error: task id = 0, error: Clef: non-finite logit
slot      release: id  0 | task 0 | stop processing: n_tokens = 358, truncated = 0
[GIN] 2026/10/03 - 10:26:54 | 500 | 4.0713753s | POST "/v1/systemone"

使用 OLLAMA_LLM_LIBRARY=cpu 进行纯 CPU 推理时,错误信息变为:

srv    send_error: task id = 3, error: Clef: cannot open model
[GIN] 2026/10/03 - 10:48:03 | 500 | 5.0045232s | POST "/v1/systemone"

原因分析

从讨论链的复现数据看,问题高度指向 Windows 版 Ollama 中 Clef 决策头的实现缺陷,而不是模型文件本身或单纯的 CUDA 数值问题:

  • 相同 manifest / blob(2aa4d39fd93b)在 WSL2 Ubuntu 下正常,33/33 层全部加载至 GPU,请求耗时 0.1–0.3 s,答案合理(问候语 noul 0.97,非问候语 0.006)。
  • 同一模型、同一 Ollama 0.35.1,在 Windows 原生环境下必失败;官方 ollama-windows-amd64.zip 与已安装版本 llama-server.exe 哈希一致,重装无效。
  • 故障不限于 CUDA:AMD ROCm on Windows、AMD Vulkan、纯 CPU、无独显场景均报告 Clef: non-finite logit,说明不是 NVIDIA 专属数值问题。
  • 强制 CPU 时错误信息从 non-finite logit 变为 cannot open model,可能是决策头权重读取/映射路径在不同后端下的表现差异,具体机制 Issue 中未给出定论,需视为可能原因。
  • 有 Mac mini M4 用户报告同一 digest 的 clef-flash:9b 在 0.35.1 上正常工作,进一步支持“Windows 构建问题”。

环境排查

  • 确认 Ollama 版本:评论区集中在 0.35.1。
  • 确认操作系统:Windows 10 / Windows 11 原生环境均为故障环境。
  • 确认模型与 digest:clef-flash:latest / clef-flash:9b,digest 2aa4d39fd93b,Q8_0,9.1B,base Qwen3.5 9B,带 qwen35.decision.* 头部。
  • 确认后端:CUDA(cuda_v13)、AMD ROCm、Vulkan、纯 CPU 均失败;WSL2 Linux 版 Ollama 正常。
  • 确认显卡与驱动:RTX 4090(driver 13.4)、RTX 3080 Ti(driver 616.64)、RTX 5070 Ti(driver 610.88)、RTX 5080(driver 610.88)、AMD Radeon iGPU、无独显 CPU 场景均有报告。
  • 确认环境变量影响:OLLAMA_CONTEXT_LENGTH 设置为 262144 或未设置(num_ctx 16384)均复现;OLLAMA_NUM_PARALLEL=1、OLLAMA_FLASH_ATTENTION=false、OLLAMA_NUM_GPU=0、CUDA_VISIBLE_DEVICES=-1、OLLAMA_IGPU_ENABLE=1 均无法规避;调整 num_ctx 到 8192 也无效。
  • 对照组:nimble、tev1:0.8b、tev1:4b 以及 clef:27b 在同一 /v1/systemone 上正常返回。

解决步骤

  1. 先做最小复现,确认当前环境确实命中该问题:用文档示例请求 /v1/systemone,观察是否返回 Clef: non-finite logit。
  2. 用对照模型验证服务本身正常:将请求中的 model 换成 nimble 或 tev1:0.8b,确认同一端点可正常返回决策结果。
  3. 确认 clef-flash 在 /v1/chat/completions 上可正常使用,以排除模型文件整体损坏的可能。
  4. 排除本机环境干扰:重装 Ollama 0.35.1、重新 pull 模型、禁用 Flash Attention、强制 CPU、调整 num_ctx 在 Issue 中均被证明无效,不必反复尝试。
  5. 可优先尝试的规避方案:在同一台机器上安装 WSL2 Ubuntu,使用官方 ollama-linux-amd64.tar.zst(v0.35.1)运行 Ollama,并把 Windows 模型商店中的同一 manifest / blob 拷贝过去,再请求 /v1/systemone。Issue 中该环境已验证可用。
  6. 如果无法使用 WSL2:改用没有 Clef 决策头的模型处理决策任务,或改用其他平台(Mac 上同一 digest 已被报告正常)运行 clef-flash。
  7. 持续关注 Ollama 官方对 Windows 版 Clef 决策头的修复;在修复发布前,Windows 原生环境不建议依赖 clef-flash 的 /v1/systemone 端点。

验证方法

在 WSL2 Ubuntu 中启动 Ollama 后,用同一模型和请求体调用 /v1/systemone,预期返回 HTTP 200 与合理的决策答案;用 ollama ps 可确认 33/33 层加载到 GPU,单次请求耗时约 0.1–0.3 s。同时可用 nimble 在 Windows 原生环境请求相同端点作为对照,确认 Windows 服务本身仍在正常工作——若对照模型成功而 clef-flash 失败,即可确认问题仍局限于 clef 决策头。

参考来源

ollama/ollama #18769

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 27726

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注