快速结论:当从 HuggingFace 导入的微调版 Qwen3 GGUF 模型即使显式设置 PARSER qwen3 仍无法正确拆分思考内容时,优先尝试改用 PARSER qwen3.5 与 RENDERER qwen3.5 组合。
适用环境:Ollama 0.32.15,Windows 11,模型为 hf.co/RefalMachine/RuadaptQwen3-8B-Hybrid-GGUF:Q4_K_M。
最快修复方案:在 Modelfile 中将 PARSER qwen3 替换为 PARSER qwen3.5 并新增 RENDERER qwen3.5,重新创建模型后思考内容可正确分离。
注意事项:该方案已在原始 Issue 中得到验证,但仅针对此特定模型;其他微调 Qwen3 模型可能需要单独测试是否兼容 qwen3.5 解析器。
问题场景
用户从 HuggingFace 导入 hf.co/RefalMachine/RuadaptQwen3-8B-Hybrid-GGUF:Q4_K_M 模型,并在 Modelfile 中显式设置 PARSER qwen3 后,调用 /api/chat 接口并传入 "think": true,期望模型输出中 message.thinking 与 message.content 正确分离。实际输出中思考内容与 标签全部混入 message.content,message.thinking 为空或缺失。
报错原文
PARSER qwen3 does not split thinking from content for HF-imported RuadaptQwen3-8B-Hybrid GGUF model
message.content: "Okay, the user said hello... [reasoning continues] ...
Here's a joke for you: ..."
原因分析
可能原因:该模型是 qwen3:8b 的微调版本,其 HuggingFace 发布版本附带了非思考型(non-thinking)模板。Ollama 的标准 Go 模板与该微调模型在 qwen3 解析器下配合不佳,导致思考内容无法正确分离。qwen3.5 的解析器/渲染器能够更好地兼容此模型的输出格式。
环境排查
- 确认 Ollama 版本为 0.32.15 或更新版本,且已通过
ollama show <model> --modelfile确认 Modelfile 中PARSER qwen3确实存在。 - 检查请求是否显式传递
"think": true参数。 - 确认使用
ollama pull正常拉取模型后,再基于其创建自定义模型。 - 对比官方库中
qwen3:8b模型是否表现正常,以排除环境配置差异。
解决步骤
- 打开 Modelfile,将
PARSER qwen3修改为PARSER qwen3.5。 - 在 Modelfile 中新增一行
RENDERER qwen3.5(可放在 PARSER 行附近)。 - 保存 Modelfile 后重新创建模型:
ollama create ruadapt-hybrid-test -f Modelfile。 - 重新发送聊天请求并确认输出分离效果。
验证方法
重新调用 /api/chat 接口(stream: false, think: true),检查返回的 message 对象中 thinking 字段包含完整推理过程,content 字段仅包含最终答案且不出现 标签。若已分离,则问题解决。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


