快速结论:该问题主要出现在 ComfyUI 的“反复运行(重复执行工作流、中途修改提示词后再次运行)”场景,表现为显存占用卡在 23.3/24 GB 附近、GPU 使用率 100% 但采样无法继续或无法停止。优先排查方向是关闭动态显存管理相关参数,并检查系统共享内存(Shared GPU Memory)是否被异常占用。
适用环境:Windows 11 / Linux,RTX 4090(Ada 架构 / GDDR6X 显存)。ComfyUI 版本跨度较大(从 0.80 到 0.19 版本均有报告),涉及 aimdo(动态显存管理)特性。Linux 和 Windows 均有复现案例。
最快修复方案:暂无确认的一步修复方案。Issue 讨论中提出的两个可优先尝试的缓解手段:
1. 在启动命令中增加 --disable-smart-memory 参数(开发者建议作为日常 workaround);
2. 在“SamplerCustomAdvanced”和“VAE Decode”节点前手动添加“Clean VRAM Used”节点以手动释放显存。
注意事项:以上两个方案均未被开发者在 Issue 中确认为根治方案,仅作为规避手段。在 4090 上该问题为高频复现;但在 5090 / 6000 Pro(Blackwell 架构)上未复现,疑似与 Ada 架构的显存管理特性相关。
问题场景
用户使用 ComfyUI 内置工作流运行 Ernie-Image 模型(关闭 prompt enhancer)时,第一次运行正常;但如果在采样过程中停止(Stop Sampling)、修改提示词、再次点击运行,显存占用会卡在 23.3/24 GB,出现类似旧版共享内存导致的系统卡顿,且无法恢复、无法再次停止采样。该问题在多个模型(Wan 2.2、LTX 2.3)和多个工作流中反复出现,尤其在“多采样器串联”场景(先高 CFG 采样 N 步,再 CFG=1 续跑)中更容易触发。另一个用户在 4090 上确认该问题在 Linux 和 Windows 都存在,且“SamplerCustomAdvanced”和“VAE Decode”节点会触发 100% GPU 占用和长时间冻结。
报错原文
Memory management issues across repeated runs
vram use typically sits at 23.3/24 and stalls similar to the system stutter we see with shared memory from before aimdo was implemented, but it never recovers, and I'm unable to stop sampling.
It mainly occurs in "SamplerCustomAdvanced" and "VAE Decode," triggering 100% GPU usage and causing prolonged freezes.
it can hang for 45+ minutes before sampling, while another fresh run whole workflow finishes in under 5m.
原因分析
可能原因:该问题与 ComfyUI 引入的 aimdo(动态显存管理/offload)机制在 Ada 架构显卡(RTX 4090)上的显存回收逻辑不完善有关。具体表现为:
1. 多次运行后,显存分配器未能正确释放上一次运行残留的显存块,导致新运行在分配显存时陷入等待或死锁;
2. 系统共享内存(Shared GPU Memory)被异常占用,导致显存和系统内存之间的换页出现卡顿;
3. 在“SamplerCustomAdvanced”和“VAE Decode”节点上,aimdo 的显存规划在特定显存水位下会陷入 100% GPU 占用但无法推进的状态。
Issue 中确认该问题在 4090 上可稳定复现,但在 5090 / 6000 Pro(Blackwell)上无法复现,因此基本可以排除单纯的工作流配置问题。
环境排查
- 操作系统:Windows 11 / Linux
- 显卡:RTX 4090(重点排查对象),5090 / 6000 Pro 未复现
- 显存:24 GB
- ComfyUI 版本:0.80 至 0.19 均有报告
- 启动参数:需确认是否启用了
--enable-dynamic-vram(aimdo) - 可尝试添加
--disable-pinned-memory参数,观察任务管理器中 GPU 的“共享 GPU 内存”占用情况
解决步骤
- (可优先尝试)关闭智能显存管理:在启动 ComfyUI 时添加
--disable-smart-memory参数。开发者确认这不会对 24GB 显存、无 offload 的工作流造成明显性能损失,可作为日常规避手段。 - (可优先尝试)手动清理显存:在“SamplerCustomAdvanced”和“VAE Decode”节点之前插入“Clean VRAM Used”节点,在关键节点前手动释放显存,降低 100% GPU 占用卡死的概率。
- 排查共享内存占用:使用
--disable-pinned-memory参数重启 ComfyUI,打开任务管理器 — 性能 — GPU 页面,观察“共享 GPU 内存”是否出现异常高位(非零或持续增长)。如果共享内存占用异常,可确认是 pinned memory / shared memory 机制导致的问题。 - 开启 aimdo verbose 日志(仅限开发者调试):在
main.py中comfy_aimdo.control.set_log_info()之后添加comfy_aimdo.control.set_log_verbose(),复现问题时记录完整日志,定位 aimdo 在哪一步“卡住”。注意:verbose 日志量极大,且开发者提示“verbose 日志有时会修复问题(heisenbug)”,可能难以稳定复现。 - 临时规避(社区方案):如果采样器卡在 0% 无法继续,直接结束 ComfyUI 进程并重新启动(Linux 和 Windows 均适用)。等待 45 分钟以上不如直接重启,新运行的工作流在 5 分钟内即可完成。
- 尝试更换 VAE Decode 实现:社区用户建议改用 “Lazy Tiled Decode” 节点,并使用 512 像素的 tile 尺寸,可避免 VAE Decode 阶段的显存异常。
验证方法
按照上述步骤操作后,重复“运行 → 停止采样 → 修改提示词 → 再次运行”的操作序列至少 3-5 次,确认:
1. 显存占用不再卡在 23.3/24 GB 附近;
2. 采样过程可以正常完成且能随时停止;
3. GPU 使用率在采样结束后回落到正常水平;
4. 任务管理器中“共享 GPU 内存”没有异常增长。
如果使用 --disable-smart-memory 后问题消失,即可确认与 aimdo 的显存管理策略有关。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


