快速结论:该报错发生在 macOS Apple Silicon 上使用 llama.cpp 加载官方 LiquidAI LFM2.5-2.6B DSpark 草稿模型进行推测解码时,首次生成请求即触发原生图断言崩溃。优先排查 llama.cpp 版本是否过旧,升级到 v0.2.0(或 b10541 及以上)即可解决。
适用环境:macOS(Apple Silicon)、llama.cpp Homebrew build 10470、目标模型 LiquidAI/LFM2.5-2.6B-Q4_K_M.gguf、草稿模型 LiquidAI/LFM2.5-2.6B-DSpark-F16.gguf。
最快修复方案:将 llama.cpp 升级到 v0.2.0(对应 ggml 0.21.0,版本号高于 b10541)。该版本已验证可修复崩溃,DSpark F16 草稿模型可正常加载并完成生成。
注意事项:暂无确认的“不升级版本”的替代修复方案;不保证其他低于 v0.2.0 的构建(包括 b10541 之前的版本)都能正常工作。
问题场景
用户使用 llama-server 加载 LFM2.5-2.6B-Q4_K_M.gguf 作为目标模型,并通过 -md 指定官方 LFM2.5-2.6B-DSpark-F16.gguf 作为草稿模型,同时启用 --spec-type draft-dspark 进行 DSpark 推测解码。服务器启动时提示 DSpark 初始化成功,但在发送首个 chat completions 请求后,客户端收到空回复且服务器进程崩溃退出。
报错原文
src/llama-graph.cpp:1352: GGML_ASSERT(t_layer_inp[il] != nullptr && "layer input tensor is null") failed
原因分析
该崩溃是 llama.cpp 旧版本(Homebrew build 10470)在 Apple Silicon 上处理 DSpark 草稿模型时,图构建过程中层输入张量为空的内部断言失败。可能原因:该版本的推测解码实现与官方 DSpark sidecar 不兼容,图构建时未能正确传递层输入张量。相同目标模型使用非 DSpark 路由(普通推测解码)不受影响,说明问题特定于 DSpark 图路径。
环境排查
- 确认 llama.cpp 版本:需升级到 v0.2.0 或 b10541 及以上版本,低于此版本的构建存在崩溃风险。
- 确认 macOS 为 Apple Silicon 架构(x86_64 环境未在此 Issue 中验证)。
- 确认目标 GGUF 与 DSpark 草稿 GGUF 均为官方发布文件,且草稿模型为 F16 精度。
- 确认命令中
--spec-type draft-dspark参数拼写正确。
解决步骤
- 备份当前 llama.cpp 配置或记录当前版本号(Homebrew build 10470 为触发崩溃的版本)。
- 升级 llama.cpp 到 v0.2.0(对应 ggml 0.21.0)或更高版本,该版本已包含修复。
- 升级后重新启动 llama-server,使用与复现时相同的启动参数(目标模型、DSpark 草稿模型、
--spec-type draft-dspark、-ngl 99等)。 - 确认服务器日志显示 DSpark 初始化成功且无图构建警告。
验证方法
升级后重新发送同样的 chat completions 请求,确认不再出现 GGML_ASSERT(t_layer_inp[il] != nullptr) 崩溃,服务器正常返回生成内容。Issue 中报告升级后草稿接受率(draft acceptance)为 0.63 和 1.00,可作为额外参考指标。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


