快速结论:这个崩溃出现在 Windows 上运行 llama-cli 加载模型时,从 build 11222 起复现,表现为卡在 Loading model... - 后直接退出。优先检查你是否在没有显式指定设备(-dev)的情况下启动;如果只能靠加 -dev 或提高日志级别才能跑起来,基本可以确认是这一回归问题。
适用环境:Issue 中确认的环境包括 Windows(Windows 10 Pro 与较新的 Windows 均有人报告)、llama.cpp 版本 0.5.0-dev(build 11222,commit a97cce86a,Clang 20.1.8,Windows x86_64);受影响后端包括 CUDA、Vulkan、ROCm,且单 GPU(Windows 只识别到 1 张卡)时也会触发。MacBook Pro M2 Max 上未复现。
最快修复方案:升级到包含修复的 build b11249(对应 #29632)或更新版本。Issue 中报告者在 b11249 确认问题已修复。
注意事项:如果你不能立刻升级,指定 -dev CUDA0、-dev ROCm0 或 -dev VULKAN0 可以绕过崩溃;给 -lv 设为 4 或更高也能让 CLI 跑起来。这些只是临时规避手段,不代表问题根因已消除;不同后端的设备名需要按本机实际可见设备填写。
问题场景
用户在 Windows 上使用 llama-cli.exe 加载 GGUF 模型(例如 Qwen3.6-35B-A3B-MTP-UD-IQ4_XS.gguf),命令中未指定 -dev。程序输出停在 Loading model... -,随后崩溃退回命令行。该问题在 CUDA、Vulkan、ROCm 三类后端的官方二进制和自编译版本上都出现过,且在多台机器(Ryzen 5950X + 5070 Ti、Intel i7-8700K + Radeon 6900 XT)上均可复现;Windows 事件查看器记录了错误码 0xc0000094。MacBook Pro M2 Max 没有该问题。
报错原文
Misc. bug: Builds b11222 and later crash unless "-dev" is specified in command line.
Loading model... -
Windows 事件查看器中的错误码:0xc0000094
原因分析
Issue 中确认这是一次回归:build 11221 正常,build 11222 起开始崩溃,并在 build 11223、11243 上继续复现。维护者指出应由 #29632 修复。结合用户反馈,崩溃发生在未显式指定设备时(-dev 为空),说明问题可能与默认设备选择或设备枚举路径有关;但这部分属于根据现象所作的推测,Issue 未给出最终根因说明。
环境排查
- 确认 llama.cpp 构建版本:是否处于 b11222 至 b11248 之间(含这些版本),b11221 与 b11249 的表现可作对照。
- 确认操作系统:Windows 10 Pro 或其它 Windows 版本。
- 确认后端:CUDA、Vulkan 或 ROCm;官方二进制与自编译版本都可能受影响。
- 确认是否使用
-dev参数,以及-lv日志级别是否低于 4。 - 确认本机可见 GPU 数量(Issue 中报告者机器均只识别到 1 张 GPU)。
解决步骤
- 优先升级到 build b11249 或更新版本,该版本包含 #29632 的修复,Issue 报告者已确认问题解决。
- 若暂时无法升级,可在命令中显式指定设备,例如
-dev CUDA0、-dev ROCm0或-dev VULKAN0,按本机实际后端和设备编号填写。 - 作为另一种临时规避,可给
-lv设置为 4 或更高,Issue 中有用户反馈这样也能让 CLI 正常运行。 - 完成上述任一处理后重新加载模型,观察是否仍卡在
Loading model... -。
验证方法
重新运行原本崩溃的 llama-cli 命令,确认不再停在 Loading model... -,能够继续加载模型并进入交互/推理流程;若使用 b11249 或更新版本且未加任何绕过参数,仍能正常运行,则说明修复已生效。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。
![[Bug]: Rust frontend chat-template rendering fails with 500 "unknown function: raise_exception" for templates that legally use it (e.g. Qwen](https://www.chat-gpts.plus/wp-content/uploads/2026/09/59009-5c4e83a4-768x403.jpg)
![[Bug]: Host memory is not reducing after the model is loaded into Intel XPU](https://www.chat-gpts.plus/wp-content/uploads/2026/09/50269-2f2deaf5-768x403.jpg)
![[Bug]: GLM-5.3 reasoning leaks into content when clients pass enable_thinking/thinking=false — parser gates on kwargs the GLM-5.3 template n](https://www.chat-gpts.plus/wp-content/uploads/2026/09/54744-b3553957-768x403.jpg)