快速结论:这个报错通常发生在 Windows + NVIDIA RTX(尤其是 RTX 5090)在 InvokeAI 中进行高分辨率生成或放大时,负载接近显卡实际 VRAM/带宽上限后出现驱动级崩溃(TDR、nvlddmkm 停止响应、GPU device lost)。优先排查两点:是否使用了不受支持的 pytorch_cuda_alloc_conf: "backend:native",以及是否已按官方低显存模式说明关闭 NVIDIA SysMem fallback。
适用环境:InvokeAI 6.14.0,Windows 11 Pro,NVIDIA RTX 5090 32GB,CUDA 环境,Invoke Launcher 安装方式。Issue 未确认具体 Python、PyTorch、驱动版本号。
最快修复方案:暂无确认的一步修复方案。Issue 维护者明确要求先改回受支持的配置再进行测试,即把 pytorch_cuda_alloc_conf 从 "backend:native" 改为 "backend:cudaMallocAsync"(InvokeAI 仅支持后者)。
注意事项:Issue 中提出的 torch_inductor_cudagraphs、torch_sdp_force_math、cuda_conservative_mode 等开关只是用户建议,InvokeAI 并未实现或确认。维护者也指出目前只有单个样本,无法确认是 InvokeAI 或 CUDA Graphs 的普遍问题,并建议用 memtest86 排查内存故障。该 Issue 因未在受支持配置下复测而被关闭。
问题场景
用户在 Windows 11 Pro + NVIDIA RTX 5090 32GB 环境下使用 InvokeAI 6.14.0,通过 Invoke Launcher 安装。低分辨率生成正常,但当持续进行 2K 及以上高分辨率生成或放大、把显卡推到接近实际 VRAM/显存带宽上限时,程序没有返回干净的 OOM 或可恢复错误,而是触发底层 CUDA/驱动失败。用户怀疑这与 llama.cpp 中可通过 GGML_CUDA_DISABLE_GRAPHS=1 规避的 CUDA Graphs kernel path 问题同源,并希望 InvokeAI 提供类似的诊断/稳定性开关。
报错原文
Display driver nvlddmkm stopped responding
GPU device lost
black screen / driver reset
CUDA launch timeout
Windows TDR reset
原因分析
按 Issue 讨论,可能原因包括:
- 用户配置中使用了
pytorch_cuda_alloc_conf: "backend:native"。维护者明确说明 InvokeAI 只测试和支持backend:cudaMallocAsync,用户自定义的 native 分配器可能本身就是问题来源。 - Windows 下 NVIDIA SysMem fallback 未按官方说明关闭,导致显存耗尽后回退到系统内存,叠加系统内存压力引发不稳定。
- 用户推测是 RTX 5090 在特定 AI 负载(高分辨率图像生成/放大)下的 CUDA kernel path / CUDA Graphs 缺陷,且可能与驱动交互有关;但维护者指出没有其他用户报告,单个样本不足以证明这是普遍问题。
- 维护者同时怀疑可能是系统内存、供电或 RAM 稳定性问题,建议用 memtest86 排查。
以上除“不受支持的 alloc conf”外,均属于推测或待验证方向,不要把 CUDA Graphs 当作已确认的根因。
环境排查
- 确认 InvokeAI 版本是否为 6.14.0,以及安装方式(Invoke Launcher)。
- 确认操作系统为 Windows 11,GPU 为 NVIDIA RTX 系列(本 Issue 为 RTX 5090 32GB)。
- 确认
pytorch_cuda_alloc_conf当前取值,是否为受支持的backend:cudaMallocAsync。 - 确认是否已按官方文档“Disabling NVIDIA SysMem fallback (Windows only)”关闭系统内存回退。
- 确认是否曾用 memtest86 等工具验证内存稳定性。
- 确认系统是否处于超频/降压状态,是否已尝试恢复默认频率。
- 确认 NVIDIA 驱动版本,并尝试更新或回退到稳定版本。
- 确认 PyTorch、CUDA、Python 及 Diffusers 相关依赖版本(Issue 未提供具体数值)。
解决步骤
- 打开 InvokeAI 配置文件,定位
pytorch_cuda_alloc_conf。 - 把
pytorch_cuda_alloc_conf: "backend:native"改为 InvokeAI 受支持的pytorch_cuda_alloc_conf: "backend:cudaMallocAsync"。 - 按官方低显存模式文档,在 Windows 上关闭 NVIDIA SysMem fallback:参考 invoke.ai 低显存模式说明。
- 将系统与显卡恢复到默认频率(移除超频/降压),并关闭后台占用显存与内存的程序。
- 更新或重装 NVIDIA 驱动后重启系统。
- 在受支持配置下复测:先做低分辨率生成,再逐步尝试 2K 及以上生成或放大,观察是否仍触发驱动崩溃。
- 如仍复现,使用 memtest86 检查内存,并记录完整复现日志,回到 Issue 或新开 Issue 提供证据。
- 关于 CUDA Graphs / SDPA math backend 的开关,属于用户建议,InvokeAI 尚未提供,可关注后续版本是否加入诊断开关;不要自行编造不存在的配置项。
验证方法
在改用 backend:cudaMallocAsync 并关闭 NVIDIA SysMem fallback 后,重复原先会触发崩溃的高分辨率生成或放大流程,确认:不再出现 nvlddmkm 停止响应、黑屏、驱动重置或 CUDA launch timeout;若显存不足,应得到 InvokeAI 可恢复的 OOM 提示而不是驱动级崩溃。若问题依旧存在,则说明当前配置改动未能解决,需要提供完整日志供维护者进一步分析。
参考来源
InvokeAI 文档:Disabling NVIDIA SysMem fallback (Windows only)
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。

![[BUG]: Weekly and monthly scheduled jobs run a day early or late when the local time is on a different UTC date](https://www.chat-gpts.plus/wp-content/uploads/2026/10/6555-578b341a-768x403.jpg)
![[Bug] Codex heterogeneous agent loses session continuity every turn (sessionId missing from stream_start, regression of #16855)](https://www.chat-gpts.plus/wp-content/uploads/2026/10/20231-3455eac7-768x403.jpg)