快速结论:本报错发生在使用 llama-bench 对 DeepSeek V4 模型进行 token 生成基准测试时,特别是在使用 Metal 或 CUDA 后端并启用 flash attention(-fa 1)的情况下。报错 Misc. bug: llama_bench error: failed to run depth (deepseek v4 + metal) 的根本原因是状态恢复(state restore)失败:llama_state_seq_set_data() 返回 0,导致重复处理 prompt 时 decode 出错。优先排查 llama.cpp 版本是否包含 PR #25325 的修复。
适用环境:
- 工具:
llama-bench(属于llama.cpp项目) - 模型:DeepSeek-V4-Flash(GGUF 格式,已知 IQ3_XXS、IQ2_XXS 等量化版本)
- 操作系统:macOS(Metal 后端)、Linux(NVIDIA CUDA 后端)
- 后端:Metal(Apple Silicon)、CUDA(NVIDIA RTX PRO 6000 等)
- llama.cpp 版本:至少到 commit 86d86ed43(version 10064)时依旧复现
- 参数:使用
-fa 1(flash attention)、-d 10000、-n 128、-p 512
最快修复方案:将 llama.cpp 更新至包含 PR #25325 合并后的版本(该 PR 已于 2026-07-28 合并入主分支)。之后重新编译并运行 llama-bench 即可。
注意事项:该修复尚未出现在任何正式发布版中,需要从源码编译主分支。如果您无法升级版本,可以尝试评论中建议的临时补丁(e414f593),但该补丁未经官方验证,风险自担。
问题场景
用户使用 llama-bench 对 DeepSeek-V4-Flash 模型的 GGUF 文件进行基准测试,命令中包含 -fa 1(flash attention)和 -d 10000(数据重复次数)。在完成首次 prompt processing(pp512 @ d10000)后,进入 token generation 阶段时状态恢复失败,导致后续 prompt 重处理出错,最终退出。
报错原文
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


