快速结论:Misc. bug: brutally bad SYCL performance on Battlemage。在 Intel Battlemage 显卡(B50/B70)上使用 llama.cpp SYCL 后端运行推理时,token 生成速度仅约 13 t/s(接近 CPU 水平),而 Vulkan 后端可达 40 t/s。优先排查:是否在虚拟机内运行、是否设定了无关优化环境变量(如 GGML_SYCL_DISABLE_OPT=1),并尝试裸机测试。
适用环境:Linux 系统(Ubuntu 24.04/26.04,含 Proxmox 虚拟机);llama.cpp build f454bd7eb;Intel Battlemage 显卡(BMG G31,B50/B70);SYCL 后端;系统内存 DDR4、PCIe 3.0(主板 X10DRi + E5-2690v4)或 PCIe 4.0(11400F 平台);模型:Gemma 4 26B A4B Q4_K_M(约 15.7 GiB,可完全放入 32GB VRAM)。
最快修复方案:暂无确认的一步修复方案。开发者建议依次尝试:① 重置所有 SYCL 相关环境变量为默认值(取消自定义设置);② 在裸机(非虚拟机)上运行测试;③ 重新编译 SYCL 后端并尝试 GGML_SYCL_F16=ON 开关(需 clean rebuild)。用户已执行上述步骤但未获得性能改善。
注意事项:① 虚拟机环境(Proxmox + PCIe passthrough)会有 5-10% CPU 性能损耗,GPU 性能影响未知,建议优先裸机测试;② GGML_SYCL_DISABLE_OPT=1 会禁用所有优化,可能导致 MoE 模型崩溃时开启,但默认应关闭以获取最佳性能;③ PCIe 带宽和内存带宽只影响模型加载速度,若模型完全载入 VRAM 则对推理速度影响不大。
问题场景
用户在 llama.cpp 中通过 SYCL 后端(Intel oneAPI)运行 llama-bench 或 llama-server 进行推理测试,使用 Battlemage 显卡(B50/B70)。无论是否设置环境变量、是否开启 F16、是否调整 PCIe 版本,推理速度均极低(tg128 约 13 t/s),而 Vulkan 后端在同硬件上可达到 40 t/s。用户还在 11400F(PCIe 4.0)平台上尝试,性能同样没有提升。
报错原文
# SYCL 后端基准测试结果(最低性能)
root@902ca48d0245:/app# ./llama-bench -m /models/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf
load_backend: loaded SYCL backend from /app/libggml-sycl.so
load_backend: loaded CPU backend from /app/libggml-cpu-haswell.so
| model | size | params | backend | ngl | test | t/s |
| ------------------------------ | ---------: | ---------: | ---------- | --: | --------------: | -------------------: |
| gemma4 26B.A4B Q4_K - Medium | 15.70 GiB | 25.23 B | SYCL | 99 | pp512 | 351.53 ± 9.93 |
| gemma4 26B.A4B Q4_K - Medium | 15.70 GiB | 25.23 B | SYCL | 99 | tg128 | 13.33 ± 0.33 |
# Vulkan 后端基准测试结果(正常性能)
root@693c84ca6e88:/app# ./llama-bench -m /models/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf
ggml_vulkan: Found 1 Vulkan devices:
ggml_vulkan: 0 = Intel(R) Graphics (BMG G31) (Intel open-source Mesa driver) | uma: 0 | fp16: 1 | bf16: 1 | warp size: 32 | shared memory: 49152 | int dot: 1 | matrix cores: none
load_backend: loaded Vulkan backend from /app/libggml-vulkan.so
load_backend: loaded CPU backend from /app/libggml-cpu-haswell.so
| model | size | params | backend | ngl | test | t/s |
| ------------------------------ | ---------: | ---------: | ---------- | --: | --------------: | -------------------: |
| gemma4 26B.A4B Q4_K - Medium | 15.70 GiB | 25.23 B | Vulkan | 99 |
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


