Misc. bug: llama_bench error: failed to run depth (deepseek v4 + metal)

本报错发生在使用 llama-bench 对 DeepSeek V4 模型进行 token 生成基准测试时,特别是在使用 Metal 或 CUDA 后端并启用 flash attention( -fa 1 )的情况下。报错 Misc. bug: llama_bench error: failed t

快速结论:本报错发生在使用 llama-bench 对 DeepSeek V4 模型进行 token 生成基准测试时,特别是在使用 Metal 或 CUDA 后端并启用 flash attention(-fa 1)的情况下。报错 Misc. bug: llama_bench error: failed to run depth (deepseek v4 + metal) 的根本原因是状态恢复(state restore)失败:llama_state_seq_set_data() 返回 0,导致重复处理 prompt 时 decode 出错。优先排查 llama.cpp 版本是否包含 PR #25325 的修复。

适用环境:

  • 工具:llama-bench(属于 llama.cpp 项目)
  • 模型:DeepSeek-V4-Flash(GGUF 格式,已知 IQ3_XXS、IQ2_XXS 等量化版本)
  • 操作系统:macOS(Metal 后端)、Linux(NVIDIA CUDA 后端)
  • 后端:Metal(Apple Silicon)、CUDA(NVIDIA RTX PRO 6000 等)
  • llama.cpp 版本:至少到 commit 86d86ed43(version 10064)时依旧复现
  • 参数:使用 -fa 1(flash attention)、-d 10000-n 128-p 512

最快修复方案:llama.cpp 更新至包含 PR #25325 合并后的版本(该 PR 已于 2026-07-28 合并入主分支)。之后重新编译并运行 llama-bench 即可。

注意事项:该修复尚未出现在任何正式发布版中,需要从源码编译主分支。如果您无法升级版本,可以尝试评论中建议的临时补丁(e414f593),但该补丁未经官方验证,风险自担。

问题场景

用户使用 llama-bench 对 DeepSeek-V4-Flash 模型的 GGUF 文件进行基准测试,命令中包含 -fa 1(flash attention)和 -d 10000(数据重复次数)。在完成首次 prompt processing(pp512 @ d10000)后,进入 token generation 阶段时状态恢复失败,导致后续 prompt 重处理出错,最终退出。

报错原文

参考来源

ggml-org/llama.cpp #25843

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 15458

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注