快速结论:该问题出现在 Windows + CUDA 12.4 的 Pascal 显卡(GTX 1050 Ti / Tesla P40)上,从 llama.cpp b11222 起 llama-cli 在加载模型时直接崩溃,而 b11221 正常。优先确认是否为已知的启动崩溃回归,并升级到 b11249 或更高版本。
适用环境:Windows 11 25H2 / Windows Server 2019;NVIDIA GTX 1050 Ti、Tesla P40(Pascal 架构);CUDA 12.4 预编译包(llama-b11222-bin-win-cuda-12.4-x64);llama.cpp build 11222(commit a97cce86a),Clang 20.1.8 Windows x86_64。
最快修复方案:升级到 b11249 或更高版本(Issue 中维护者确认 #29551 已由 #29632 修复,请使用 b11249 或更新构建验证)。
注意事项:该结论来自维护者在评论中的说明,本 Issue 自身并未附带用户回帖确认;若升级后仍然崩溃,请重新收集日志并另开新 Issue。
问题场景
用户在 Windows 上使用 llama.cpp 的 CUDA 12.4 预编译包运行 llama-cli.exe 加载 GGUF 模型(如 HY-MT1.5-1.8B-Q4_K_M.gguf)。在 b11221 时能正常进入交互式命令行界面,升级到 b11222 后执行同样的命令,输出停在初始化阶段——只打印了 build、device_info、system_info、HTTP server 初始化等日志,随后直接退出回命令行,没有显示常见的启动 banner,也没有进入 > 提示符,且任何模型都一样。
报错原文
version: 0.5.0-dev (build 11222, commit a97cce86a)
built with Clang 20.1.8 for Windows x86_64
Loading model... |0.00.007.500 I cmn common_param: common_params_print_info: build 11222 (a97cce86a) with Clang 20.1.8 for Windows x86_64
0.00.007.514 I cmn common_param: device_info:
0.00.007.591 I cmn common_param: system_info: n_threads = 6 (n_threads_batch = 6) / 12 |
0.00.007.695 I srv init_listene: running without SSL
0.00.007.911 D srv init_listene: serve nocache for build.json
0.00.007.948 I srv init: using 11 threads for HTTP server
0.00.008.014 W srv llama_server: security: no API key is set and CORS allows all origins
C:\Users\Administrator\Desktop\llama-b11222-bin-win-cuda-12.4-x64>
注:Issue 中 llama.cpp 自身的报错日志并未包含明确的异常文本,只表现为进程在启动早期无提示退出。标题中的报错关键词为 Eval bug: Crash on startup with Pascal GPU on Windows after b11222。
原因分析
根据维护者评论,本问题很可能与 #29551 是同一缺陷,即 b11222 引入的启动期回归,并在 #29632 中修复(对应 b11249 或之后的构建)。该回归只在特定环境组合下暴露:Windows + CUDA 12.4 预编译包 + Pascal 架构显卡(GTX 1050 Ti / Tesla P40)。
由于标题标注为 “Pascal GPU”,可优先怀疑 b11222 中 CUDA 后端针对 Pascal 的初始化路径或设备相关代码发生了兼容性变化,导致在模型加载或设备枚举阶段提前崩溃。这一推断未在 Issue 中给出明确代码证据,属于可能原因,不代表已确认结论。
环境排查
- 确认 llama.cpp 构建版本:是否处于 b11222 至 b11249 之间的范围(
llama-cli --version可看到 build 和 commit)。 - 确认 CUDA 运行时/驱动:是否为 CUDA 12.4 预编译包,Windows 下 NVIDIA 驱动是否与 Pascal 卡兼容。
- 确认显卡型号:GTX 1050 Ti(Pascal,GP107)、Tesla P40(Pascal,GP102)。
- 确认操作系统:Windows 11 25H2 或 Windows Server 2019。
- 确认模型:加载任意 GGUF 模型都会复现,可排除单个模型文件损坏的可能。
- 如仍无法确定,可对比同机上 b11221 与 b11222 的行为,确认是否为版本回归。
解决步骤
- 确认当前使用的是否为 b11222 或之后的、但早于 b11249 的构建;如果是,记录下
llama-cli --version输出的 build 号。 - 下载并切换到 b11249 或更新版本的 Windows CUDA 12.4 预编译包。
- 用同样的命令行重新运行,例如:
llama-cli.exe --model <你的模型路径> --verbose,模型路径保持与原复现步骤一致。 - 如果升级到 b11249 后不再崩溃,可认为与 #29551 的修复一致;如果仍崩溃,则按新问题处理,保留完整日志并附上显卡、驱动、CUDA 版本信息。
验证方法
升级到 b11249 或更高版本后,重新执行相同命令,观察是否能够正常显示启动 banner 并进入 > 交互提示符。若进程不再在初始化阶段直接退出、能正常加载模型并接受输入,即视为问题已解决。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。

![[ROCm] rocm_unquantized_gemm crashes on CPU tensors (dispatch ignores tensor device)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/58922-44795438-768x403.jpg)
![[RFC]: DeepSeek-V4.1-Flash performance on ROCm](https://www.chat-gpts.plus/wp-content/uploads/2026/09/56506-e598e1d1-768x403.jpg)