快速结论:此报错发生在 llama.cpp 使用 Vulkan 后端在 AMD Ryzen AI MAX+ 上加载 Qwen 27B 系列多模态模型(Qwen3.8/3.6)时,一旦向 WebUI 提交图片,服务端会静默崩溃。优先排查 Vulkan 后端对多模态推理的支持情况,以及是否缺少 –image-min-tokens 1024 参数。
适用环境:Windows(x86_64)、llama.cpp(版本 0.1.0-dev,build 10437,commit 16d222fc5)、GGML 后端为 Vulkan、AMD Ryzen AI MAX+ 395(128GB 共享内存)、多模态模型 ggml-org/Qwen3.8-27B-GGUF(Q8_0)。
最快修复方案:暂无确认的一步修复方案。Issue 中用户尝试通过增加 –image-min-tokens 1024 参数后问题依旧存在,因此没有已验证的首选处理方法。
注意事项:此问题在 Qwen3.8(unsloth 与 ggml-org 版本)和 Qwen3.6(unsloth 版本)上均出现,说明并非新引入的 Bug。当前 Issue 状态为 “bug-unconfirmed”,尚未定位到确切的代码级原因。
问题场景
用户通过命令行为 llama.cpp 的 llama-server 启动多模态推理服务(Qwen3.8-27B),使用 Python 环境或直接通过 WebUI 访问,并上传图片询问模型“图中看到了什么”。服务端在 prompt processing 阶段(仅处理了 46 个 token 后)静默崩溃并直接退回终端,错误码为 Windows 上的 -1073740791(即 STATUS_ACCESS_VIOLATION)。值得注意的是,纯文本对话配合 MTP(多 token 预测)工作正常,说明问题与视觉分支(Vision)逻辑相关。
报错原文
68.59.734.505 I slot print_timing: id 3 | task 0 | prompt processing, n_tokens = 46, progress = 0.02, t = 4.81 s / 9.57 tokens per second
<crash and back to terminal> C:\LLM\vLLM>
实际退出错误码(Windows):-1073740791 (对应 STATUS_ACCESS_VIOLATION)。
原因分析
从现有证据看,问题极可能在 Vulkan 后端处理多模态(视觉)张量时发生代码路径访问异常。可能原因包括:
- Vulkan 后端对 Qwen-VL(Qwen3.6/3.8)的视觉投影层(mmproj 部分算子)支持不完整,导致越界访问。
- 共享内存机制(128GB shared memory)与 Vulkan 显存分配/回收策略不兼容,在图像推理阶段触发访问违例。
- 缺少
--image-min-tokens 1024参数时,视觉通道 token 不足导致 grounding 任务逻辑走错分支(虽然增加了该参数后问题依旧)。
环境排查
- 确认 llama.cpp 版本:应为 build 10437(commit 16d222fc5),若更新需重新验证。
- 确认 GGML 后端:Issue 中仅验证了 Vulkan 后端,未提及 CUDA/ROCm。建议判断是否仅 Vulkan 触发。
- 确认操作系统:Windows x86_64;Linux 或 macOS 上的表现未知。
- 确认 CPU/GPU 环境:AMD Ryzen AI MAX+ 395,128GB 共享内存。
- 确认模型来源及格式:ggml-org/Qwen3.8-27B-GGUF Q8_0 或 unsloth 版 Qwen3.6/Qwen3.8 均能复现。
- 确认已添加参数:
--image-min-tokens 1024(Issue 中属于尝试过的方案但未解决)。
解决步骤
- 可优先尝试(推测方案):切换 GGML 后端(例如使用 ROCm 或 CPU 后端)进行交叉验证,确认是否为 Vulkan 特有缺陷。
说明:Issue 中未验证此方案,属于推测性排查,可优先尝试。 - 补充参数尝试:运行服务时加入
--image-min-tokens 1024,观察是否仍崩溃。Issue 中用户测试后确认无效,但该参数在启用 grounding 任务时仍建议保留。 - 对比测试:使用不同量化(Q8_0 vs Q6_K)及不同来源(ggml-org vs unsloth)进行复现,确认是否为量化或模型文件本身问题。
- 检查 Vulkan 驱动:确保 AMD 显卡驱动及 Vulkan 运行库为最新版本(Issue 未明确提及驱动版本,属常见排查步骤)。
- 汇报上游:由于 Issue 处于 “bug-unconfirmed” 状态,建议将复现命令、日志及崩溃转储(如可用)提交至 llama.cpp 官方仓库,协助定位。
验证方法
再次通过 llama-server 加载多模态模型并上传图片,观察 prompt processing 阶段是否能完整完成 token 处理而无静默退出。若不再出现代码 -1073740791 且能正常生成回答,则问题已规避或解决。若仍崩溃,说明问题与 Vulkan/视觉分支相关,需等待上游修复。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


