ollama create fails on Qwen3.8-Flash-Next GGUF: “failed to validate GGUF with llama-quantize without compatibility patches” (same error as #

该报错发生在 Ollama 导入新架构模型的 GGUF 文件时,因为 Ollama 内置的 llama-quantize 尚未包含该架构的兼容补丁。优先排查你的模型架构是否在 Ollama 当前支持列表中,并考虑升级 Ollama 或等待官方支持。

快速结论:该报错发生在 Ollama 导入新架构模型的 GGUF 文件时,因为 Ollama 内置的 llama-quantize 尚未包含该架构的兼容补丁。优先排查你的模型架构是否在 Ollama 当前支持列表中,并考虑升级 Ollama 或等待官方支持。

适用环境:Ollama 0.33.2(报告时最新版);Ubuntu(kernel 6.17.0-1031-nvidia,aarch64/DGX Spark);NVIDIA GB10 GPU,驱动 580.173.02,CUDA 13.0;模型为 Qwen3.8-Flash-Next(unsloth UD-Q4_K_XL 量化,4 个分片)。

最快修复方案:暂无确认的一步修复方案。该 Issue 被标记为 #18075 的重复,确认 Qwen3.8-Flash-Next 当前是不被支持的新架构,需等待 Ollama 添加对应兼容补丁。

注意事项:重启 Ollama 服务、清理缓存均被证实无效;失败创建会遗留孤儿 blob 占用磁盘空间,需手动清理(下文提供命令)。

问题场景

用户在 Ollama 中通过 Modelfile 导入本地下载的 Qwen3.8-Flash-Next 分片 GGUF 量化文件时,所有分片复制完成后,在 GGUF 解析/验证步骤失败。该模型在原生 llama.cpp(GPU 构建)中可以正常加载和推理,问题定位在 Ollama 内部使用的 llama-quantize 不识别该新架构。

报错原文

Error: failed to validate GGUF with llama-quantize without compatibility patches: llama-quantize failed: exit status 1

原因分析

模型架构(Qwen3.8-Flash-Next)过新,Ollama 内置的 llama-quantize 尚未包含对应的兼容补丁。该错误文本与 #17279(GLM-5.2 架构)完全一致,表明这是一个“新模型架构尚未被 Ollama 兼容补丁集覆盖”的通用类问题,而非单个模型特有的 bug。Mainline llama.cpp 已支持该架构,但 Ollama 的 vendored/patched 版本落后。

环境排查

  • 确认 Ollama 版本(0.33.2 或更高)是否已包含该架构支持;可检查 Ollama 更新日志或 GitHub 上的支持列表。
  • 确认模型架构名称(可从 GGUF 元数据中读取),并与已支持的架构列表比对。
  • 确认 GGUF 文件完整性:使用原生 llama.cpp 的 llama-server 或 gguf-dump 验证文件可正常加载。
  • 注意:Ollama 导入分片 GGUF 时,必须在 Modelfile 中显式列出所有分片,否则会报“split GGUF has 1 shards, expected 4”错误。

解决步骤

  1. 确认你的模型架构是否在 Ollama 当前支持列表中;可在 #18075 中查看新架构支持进展。
  2. 如果 Ollama 有更新版本(高于 0.33.2),先升级到最新版再重试 ollama create
  3. 等待官方为该架构添加兼容补丁;在 Issue 或相关 PR 中跟进进展。
  4. 如果急需使用该模型,可绕过 Ollama,直接使用 llama.cpp 构建的 llama-server 加载 GGUF 文件。
  5. 清理失败 create 遗留的孤儿 blob(在 DGX Spark 上验证可用):
    ls -p /usr/share/ollama/.ollama/models/blobs/ | grep -v / | sort > /tmp/disk_blobs.txt && \
    sudo grep -o -E 'sha256:[a-f0-9]{64}' -r /usr/share/ollama/.ollama/models/manifests/ | awk -F'sha256:' '{print "sha256-" $2}' | sort -u > /tmp/active_blobs.txt && \
    comm -23 /tmp/disk_blobs.txt /tmp/active_blobs.txt | xargs -I {} sudo rm -f /usr/share/ollama/.ollama/models/blobs/{} && \
    sudo rm -rf /usr/share/ollama/.ollama/models/blobs/split-gguf-* && \
    rm -f /tmp/disk_blobs.txt /tmp/active_blobs.txt && \
    sudo du -sh /usr/share/ollama/.ollama

验证方法

重试 ollama create 命令,确认不再出现“failed to validate GGUF with llama-quantize”错误,且 ollama list 能看到新创建的模型条目。如果仍在同一错误处失败,说明该架构确实尚未被支持,需等待官方更新。

参考来源

ollama/ollama #18146

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 21234

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注