快速结论:该报错通常出现在 Windows 版 Ollama 调用 clef-flash(Q8_0、9.1B)的 /v1/systemone 决策端点时,模型在首次前向传播(prompt 处理)阶段就失败;优先确认是否为 Windows 构建的已知缺陷,并尝试改用 WSL2 / Linux 环境。
适用环境:Issue 中已确认的环境包括 Ollama 0.35.1、Windows 10.0.26300 / Windows 11 10.0.26300.9457 / Windows 10 Pro 10.0.19045、模型 clef-flash:latest(digest 2aa4d39fd93b,Q8_0,9.1B,base Qwen3.5 9B),后端涵盖 CUDA(RTX 4090 / 3080 Ti / 5070 Ti / 5080)、AMD ROCm、Vulkan、纯 CPU,以及官方 Linux 版 Ollama 在 WSL2 下。评论区还报告了无独显、启用 OLLAMA_IGPU_ENABLE=1 的场景。
最快修复方案:暂无确认的一步修复方案。Issue 中已验证可行的规避方式是在同一台机器上改用 WSL2 Ubuntu + 官方 Linux 版 Ollama(ollama-linux-amd64.tar.zst)运行,clef-flash 在该环境下可正常工作。
注意事项:该结论基于单一 Issue 讨论链中的用户验证,并非官方修复公告;重装 Ollama 0.35.1、重新 ollama pull 模型、强制 CPU、调整 num_ctx 均已被报告无效。不要据此断定模型文件损坏——相同 manifest 与 blob 在 WSL2 和 Mac 上均正常。
问题场景
用户在 Ollama 0.35.1(Windows)中拉取带 Clef 决策头的 clef-flash(Q8_0,9.1B),然后请求 /v1/systemone 决策端点。无论是文档中的最简示例,还是包含 noul、choice、score 多种问题的复杂请求,都会在 prompt 处理阶段直接返回 HTTP 500。相同的 clef-flash 模型在 /v1/chat/completions 上工作正常;同机上的 clef:27b(Q4_K_M)以及没有 Clef 决策头的模型(如 nimble、tev1:0.8b、tev1:4b)在 /v1/systemone 上也正常。
报错原文
{"error":{"code":500,"message":"Clef: non-finite logit","type":"server_error"}}
srv send_error: task id = 0, error: Clef: non-finite logit
slot release: id 0 | task 0 | stop processing: n_tokens = 358, truncated = 0
[GIN] 2026/10/03 - 10:26:54 | 500 | 4.0713753s | POST "/v1/systemone"
使用 OLLAMA_LLM_LIBRARY=cpu 进行纯 CPU 推理时,错误信息变为:
srv send_error: task id = 3, error: Clef: cannot open model
[GIN] 2026/10/03 - 10:48:03 | 500 | 5.0045232s | POST "/v1/systemone"
原因分析
从讨论链的复现数据看,问题高度指向 Windows 版 Ollama 中 Clef 决策头的实现缺陷,而不是模型文件本身或单纯的 CUDA 数值问题:
- 相同 manifest / blob(
2aa4d39fd93b)在 WSL2 Ubuntu 下正常,33/33 层全部加载至 GPU,请求耗时 0.1–0.3 s,答案合理(问候语 noul 0.97,非问候语 0.006)。 - 同一模型、同一 Ollama 0.35.1,在 Windows 原生环境下必失败;官方
ollama-windows-amd64.zip与已安装版本llama-server.exe哈希一致,重装无效。 - 故障不限于 CUDA:AMD ROCm on Windows、AMD Vulkan、纯 CPU、无独显场景均报告
Clef: non-finite logit,说明不是 NVIDIA 专属数值问题。 - 强制 CPU 时错误信息从
non-finite logit变为cannot open model,可能是决策头权重读取/映射路径在不同后端下的表现差异,具体机制 Issue 中未给出定论,需视为可能原因。 - 有 Mac mini M4 用户报告同一 digest 的
clef-flash:9b在 0.35.1 上正常工作,进一步支持“Windows 构建问题”。
环境排查
- 确认 Ollama 版本:评论区集中在 0.35.1。
- 确认操作系统:Windows 10 / Windows 11 原生环境均为故障环境。
- 确认模型与 digest:
clef-flash:latest/clef-flash:9b,digest2aa4d39fd93b,Q8_0,9.1B,base Qwen3.5 9B,带qwen35.decision.*头部。 - 确认后端:CUDA(
cuda_v13)、AMD ROCm、Vulkan、纯 CPU 均失败;WSL2 Linux 版 Ollama 正常。 - 确认显卡与驱动:RTX 4090(driver 13.4)、RTX 3080 Ti(driver 616.64)、RTX 5070 Ti(driver 610.88)、RTX 5080(driver 610.88)、AMD Radeon iGPU、无独显 CPU 场景均有报告。
- 确认环境变量影响:
OLLAMA_CONTEXT_LENGTH设置为 262144 或未设置(num_ctx 16384)均复现;OLLAMA_NUM_PARALLEL=1、OLLAMA_FLASH_ATTENTION=false、OLLAMA_NUM_GPU=0、CUDA_VISIBLE_DEVICES=-1、OLLAMA_IGPU_ENABLE=1均无法规避;调整num_ctx到 8192 也无效。 - 对照组:
nimble、tev1:0.8b、tev1:4b以及clef:27b在同一/v1/systemone上正常返回。
解决步骤
- 先做最小复现,确认当前环境确实命中该问题:用文档示例请求
/v1/systemone,观察是否返回Clef: non-finite logit。 - 用对照模型验证服务本身正常:将请求中的
model换成nimble或tev1:0.8b,确认同一端点可正常返回决策结果。 - 确认
clef-flash在/v1/chat/completions上可正常使用,以排除模型文件整体损坏的可能。 - 排除本机环境干扰:重装 Ollama 0.35.1、重新 pull 模型、禁用 Flash Attention、强制 CPU、调整
num_ctx在 Issue 中均被证明无效,不必反复尝试。 - 可优先尝试的规避方案:在同一台机器上安装 WSL2 Ubuntu,使用官方
ollama-linux-amd64.tar.zst(v0.35.1)运行 Ollama,并把 Windows 模型商店中的同一 manifest / blob 拷贝过去,再请求/v1/systemone。Issue 中该环境已验证可用。 - 如果无法使用 WSL2:改用没有 Clef 决策头的模型处理决策任务,或改用其他平台(Mac 上同一 digest 已被报告正常)运行
clef-flash。 - 持续关注 Ollama 官方对 Windows 版 Clef 决策头的修复;在修复发布前,Windows 原生环境不建议依赖
clef-flash的/v1/systemone端点。
验证方法
在 WSL2 Ubuntu 中启动 Ollama 后,用同一模型和请求体调用 /v1/systemone,预期返回 HTTP 200 与合理的决策答案;用 ollama ps 可确认 33/33 层加载到 GPU,单次请求耗时约 0.1–0.3 s。同时可用 nimble 在 Windows 原生环境请求相同端点作为对照,确认 Windows 服务本身仍在正常工作——若对照模型成功而 clef-flash 失败,即可确认问题仍局限于 clef 决策头。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


