快速结论:该报错发生在 Intel Arc iGPU(Meteor Lake)上运行 llama.cpp 最新版 SYCL 后端时,模型热启动(warmup)阶段进程静默崩溃。优先排查并移除环境变量 SYCL_CACHE_PERSISTENT=1,该优化在新版本中已失效并导致崩溃。
适用环境:llama.cpp server-intel 最新版(版本号 8667,c08d28d08),SYCL 后端,Intel Arc Graphics(Meteor Lake-P,Core Ultra 7 155H),Linux/Unraid 7.3.0,i915 内核驱动,Docker 部署。
最快修复方案:在 Docker 环境变量中删除 SYCL_CACHE_PERSISTENT=1。Issue 中用户确认移除该变量后静默崩溃消失,warmup 恢复正常。
注意事项:该修复方案仅在原 Issue 的 Linux/Unraid + Meteor Lake 环境中验证。Windows 11 用户报告类似问题时,即使未设置该变量仍会失败,说明 Meteoro Lake iGPU 与 SYCL 后端可能存在更深层的兼容性问题。
问题场景
用户在 Docker 容器中运行 ghcr.io/ggml-org/llama.cpp:server-intel(最新版)启动 llama-server,加载 Qwen3.5-4B 或 gemma-4-E2B 等 GGUF 模型。进程能正常加载 SYCL 后端、将模型全部层(33/33)卸载到 GPU(占用 5665 MiB),但在打印 warming up the model with an empty run 后进程静默退出,无任何错误信息、segfault 日志或 SYCL 错误输出。
报错原文
load_backend: loaded SYCL backend from /app/libggml-sycl.so
load_backend: loaded CPU backend from /app/libggml-cpu-alderlake.so
version: 8667 (c08d28d08)
built with IntelLLVM 2025.3.2 for Linux x86_64
Eval bug: [Bug] server-intel latest crashes during warmup on Intel Arc iGPU (Meteor Lake) — regression from b8477
Reaches "warming up the model with an empty run"
Process dies silently — no error message, no segfault log, no SYCL error
原因分析
根据 Issue 中的定位,根本原因是 SYCL_CACHE_PERSISTENT=1 环境变量。该变量用于启用 SYCL 持久化缓存优化,但在新版本(8667)中该优化已失效,导致 warmup 阶段触发静默崩溃。回退到旧版本 b8477 则正常,说明这是一个从 b8477 引入的回归问题。
可能原因还包括:新版本(8667)未打印构建版本字符串(日志中缺少 version 行),提示构建流程或启动路径可能有变化;Meteor Lake iGPU 的 Level Zero 驱动与新版 SYCL 后端存在未完全兼容的问题。
环境排查
- 确认 llama.cpp 版本:
server-intel镜像的版本号是否为 8667(c08d28d08),旧版 b8477(ec2b787eb)是否正常。 - 检查 GPU 设备:
lspci | grep -i vga应显示 Meteor Lake-P [Intel Arc Graphics]。 - 核对 Docker 环境变量:重点检查是否设置了
SYCL_CACHE_PERSISTENT=1。 - 确认内核驱动:
modinfo i915应输出描述为 Intel Graphics。 - 确认 Intel 编译器版本:新版为 IntelLLVM 2025.3.2,旧版为 2025.2.1(仅记录,不一定是根因)。
解决步骤
- 编辑 Docker Compose 文件,在
environment部分删除SYCL_CACHE_PERSISTENT=1这一行。 - 重新启动容器:
docker compose up -d llama或使用你惯用的容器启动命令。 - 等待模型加载完成,确认 warmup 阶段能顺利通过。
- 如果删除该变量后仍崩溃,可优先尝试回退镜像到
ghcr.io/ggml-org/llama.cpp:server-intel-b8477,该版本已验证可用。 - 若问题依旧且使用 Windows 系统,可尝试旧版本
b5377(Issue 中用户确认可正常工作),但需注意这是较老版本,功能可能不完整。
验证方法
启动容器后观察日志:若能正常打印 server is listening on http://0.0.0.0:8080 之类的监听消息,且 warmup 耗时约 15 秒完成,说明问题已解决。也可以执行一次简单的推理请求(如 llama-cli -m model.gguf -p "hi" -n 5),确认输出正常且进程不会意外退出。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


