快速结论:MTP 推测解码时,草稿接受率在特定 --ctx-size(如 12032、17024 等)下骤降至近零,导致吞吐量低于无 MTP 基线。该问题呈现约 2048 token 的周期性,优先排查 GPU 电压稳定性或调整 --ctx-size 避开故障区间。
适用环境:llama.cpp b9305,Linux x86_64,CUDA 后端,NVIDIA GeForce RTX 5060 Ti,模型 Qwen3.6-35B-A3B-UD-IQ2_M.gguf,KV 缓存 q8_0,MTP N=2。
最快修复方案:暂无官方提交的代码修复。根据用户反馈,将 GPU 电压恢复为默认设置(撤销欠压)后问题立即消失——可优先尝试此操作。若无效,可修改 --ctx-size 至临近的“安全”值(如 12288 而非 12032)临时绕过。
注意事项:电压修正仅为单用户经验,未在 Issue 中得到官方复现确认;根因可能仍是 KV 缓存槽边界对齐问题,电压不稳定只是加剧了冲突。
问题场景
用户在 llama-server 中启用 --spec-type draft-mtp 进行多 token 推测解码,并设置 --ctx-size 为特定值(如 12032)时,草稿接受率(acceptance rate)从正常的 ~70% 暴跌至 ~16%,使 MTP 加速比从 1.84x 退化为 1.12x(低于无 MTP 基线)。调整 --ctx-size 仅 256 token(如 12032 → 12288)后恢复速度。
报错原文
# 无崩溃或错误日志。核心表现:
# 在特定 ctx-size 下,MTP draft acceptance rate 接近 0%
# 例如 ctx=12032 时 AR=16%,ctx=12288 时 AR=71%
# Pattern repeats at ~2048-aligned intervals:
# 17024 → 0.88x speedup (0% AR), 18432 → 1.68x speedup (61% AR)
# 22016 → 0.94x, 22336 → 1.74x, 24064 → 0.89x, 24576 → 1.75x
原因分析
可能原因:MTP 草稿上下文与目标上下文在 KV 缓存中共享槽位时,--ctx-size 导致 KV 池边界按 ~2048 token 周期对齐,触发槽位管理冲突(slot index misalignment),使 draft 的 KV 缓存访问异常,从而拒绝几乎全部草稿 token。另一用户反馈其显卡欠压(undervolt)同样会引发此问题,恢复默认电压后修复,表明 GPU 不稳定可能放大该边界冲突。
环境排查
- llama.cpp 版本:b9305(63248fc3e)及更早的 b9295(95405ac65)均受影响
- GGML 后端:CUDA
- GPU:NVIDIA GeForce RTX 5060 Ti,驱动/固件版本未提及,建议确认是否开启过电压调整(undervolt)
- 模型:Qwen3.6-35B-A3B-UD-IQ2_M.gguf(35B MoE,IQ2_M 量化);9B 模型同样受影响但幅度较小
- KV 缓存量化:
--cache-type-k q8_0 --cache-type-v q8_0(q4_0 也受影响) - 上下文大小:问题在 4096/8192 正常,在 12032、17024、22016、24064 等值附近崩溃
解决步骤
- 优先尝试:检查 GPU 电压设置,恢复为厂商默认值(关闭 undervolt / overclock),重启服务后测试。
- 若无效,修改
--ctx-size值为邻近的“安全”大小(如 12288、18432、24576 等),实测可恢复 MTP 性能。 - 跟踪上游 Issue(#23658)等待代码修复;可在 llama.cpp 仓库中搜索“KV slot boundary”或“MTP acceptance rate collapse”获取最新补丁。
验证方法
使用相同的 prompt 和 max_tokens=256 请求,对比 --ctx-size 在“问题值”与“安全值”下的 MTP 加速比(TG tokens/sec)和接受率(AR%)。若 AR 从 60% 且加速比 >1.5x,则问题已解决。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


