快速结论:这个报错通常出现在用 vLLM 加载 GLM5.3-Flash 并开启 DFlash2 推测解码时,模型加载阶段抛出 RuntimeError: Model does not support EAGLE3 interface。优先排查你使用的 vLLM 版本或 Docker 镜像是否已经支持 GLM5.3-Flash,以及是否错误启用了 DFlash2。
适用环境:Issue 中确认的环境为 vLLM v0.29.0、Python 3.12、H100 上 TP8 部署;涉及模型 glm53-flash;后续使用 GLM5.3-Flash 的 Docker 镜像并配合 DFlash2 时再次失败。
最快修复方案:Issue 中已验证的有效做法是:不要使用 vLLM v0.29.0,改用官方更新后的 glm5.3-flash Docker 镜像或安装最新 nightly wheel;如果仍要跑推测解码,改用 MTP 而不是 DFlash2。
注意事项:v0.29.0 标签落后 main 分支 416 个提交,GLM5.3-Flash 的支持提交没有进入该版本。截至目前 Issue 讨论,vLLM 尚未支持 DFlash2;即便换用新镜像,使用 DFlash2 仍会失败。MTP 在 Issue 中被确认可用,但并非 DFlash2 的替代方案。
问题场景
用户在 vLLM v0.29.0 下加载 GLM5.3-Flash 的 safetensors 检查点,模型加载进度刚显示 Loading safetensors checkpoint shards: 0% Completed | 0/62 时,TP 工作进程启动失败。后续升级到官方更新的 glm5.3-flash Docker 镜像后,模型本身可以加载,但在配合 DFlash2 推测解码使用时,进程又在加载阶段报出 EAGLE3 接口相关错误。
报错原文
WorkerProc failed to start.
...
File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/model_runner.py", line 405, in load_model
set_eagle3_aux_hidden_state_layers(self.model, self.speculative_config)
File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/spec_decode/eagle/eagle3_utils.py", line 20, in set_eagle3_aux_hidden_state_layers
raise RuntimeError("Model does not support EAGLE3 interface")
RuntimeError: Model does not support EAGLE3 interface
原因分析
存在两层可能原因:
第一层是版本问题。Issue 评论指出 v0.29.0 标签落后 main 分支 416 个提交,GLM5.3-Flash 的支持提交没有包含在该版本中,所以 v0.29.0 会加载检查点失败。也有用户反馈在 vllm/vllm-openai Docker 中可以运行 glm53-flash。
第二层是推测解码后端不匹配。更新镜像后,如果继续使用 DFlash2,vLLM 会尝试按 EAGLE3 接口初始化辅助隐藏状态层,而当前 GLM5.3-Flash 模型未提供 EAGLE3 接口,于是抛出 RuntimeError: Model does not support EAGLE3 interface。Issue 评论明确表示 vLLM 尚未支持 DFlash2,并指向相关 PR 作为后续工作。
环境排查
- 确认当前 vLLM 版本是否为 v0.29.0;如果是,需注意该版本不包含 GLM5.3-Flash 支持。
- 确认使用的 Docker 镜像标签:Issue 中有人使用
vllm/vllm-openai镜像成功运行 glm53-flash,官方后续也更新了 glm5.3-flash 专用镜像。 - 确认推测解码配置:Issue 中确认 MTP 可用,DFlash2 不可用。
- 确认 Python 版本为 3.12(Issue 环境)。
- 确认部署形态与并行度:Issue 环境为 H100 TP8。
解决步骤
- 如果还在用 vLLM v0.29.0,先停止基于该版本的部署。Issue 评论明确指出 v0.29.0 不支持 GLM5.3-Flash,且该标签落后
main分支 416 个提交。 - 改用官方更新后的 glm5.3-flash Docker 镜像,或安装最新 nightly wheel。Issue 维护者确认已更新 glm5.3-flash Docker 镜像并给出了这两种可选途径。
- 如果换用新镜像或 nightly wheel 后仍计划使用推测解码,把 DFlash2 切换为 MTP。Issue 中多方确认 MTP 可以正常工作,DFlash2 会导致
RuntimeError: Model does not support EAGLE3 interface。 - 如果必须使用 DFlash2,暂时没有可用的修复方案。Issue 维护者表示“we haven’t support DFlash2 yet, will work on it tho”,需要等待后续 PR 合并。
验证方法
使用更新后的镜像或最新 nightly wheel 加载 GLM5.3-Flash,确认 safetensors 检查点分片能够完整加载且 worker 不再启动失败。如果启用了推测解码,确认配置中使用的是 MTP;此时日志中不应再出现 RuntimeError: Model does not support EAGLE3 interface。如果仍使用 DFlash2,该报错预期仍会出现。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。

![[BUG]remove model](https://www.chat-gpts.plus/wp-content/uploads/2026/09/41570-bab8c28c-768x403.jpg)
