快速结论:该 OOM / 内存泄漏问题出现在 ComfyUI 的Comfy Compiler(Aimdo/AimDo)与 kijay 的 Blocksparse / Sparse Attention 节点同时启用的场景中,优先排查两者的兼容性,可通过禁用 Comfy Compiler(添加 --disable-comfy-compiler 参数)或升级到包含相关修复的版本验证。
适用环境:ComfyUI(GitHub 最新 master 分支);Linux;Python 3.14.7;Torch 2.13 + CUDA 13.0;RTX 4060 8GB + 16GB RAM。使用了 ComfyUI-Manager 的 Python 环境,模型为 kijay 的 4bit w4a8 FL2Va MiniMax 模型,附加 Sage Attention、Blocksparse / Sparse Attention 节点、MiniMax H3 Chunk FeedForward(KJNodes)等。
最快修复方案:暂无一步到位的正式修复方案,但有两类被证明有效的规避手段:
- 临时规避:添加
--disable-comfy-compiler启动参数,禁用 Comfy Compiler 后内存占用降至约 5.7/8GB,且不再发生 OOM。 - 官方修复:引用该 Issue 关联的 PR #16148,该 PR 已被确认修复此问题。可优先尝试。
注意事项:--disable-comfy-compiler 生效时,Comfy Compiler 的相关性能优化可能失效(视频生成速度增益不明显),且内存利用率会出现冗余,但能避免崩溃;该方法尚未验证在所有情况下完全等效于修复方案,属于临时规避。启动时使用 --use-sage-attention 的同时叠加 Blocksparse 节点可能有额外加速与内存优化交互,相关机制尚未完全明确。
问题场景
用户运行 MiniMax H3 视频生成 工作流,使用 kijay 的 4bit w4a8 FL2Va 模型 + ComfyUI(最新 GitHub master 版) + Aimdo(AimDo)Comfy Compiler PR(0.5.2),配合 kijay 的 Blocksparse / Sparse Attention 节点(INT8 Sol attention)及 MiniMax H3 Chunk FeedForward(KJNodes),在 RTX 4060 8GB 环境下触发 OOM 和 GPU 内存泄漏,生成在十几个采样步骤后崩溃。禁用 Blocksparse 节点后一切正常。
报错原文
bug (memory leak & OOM) New comfy aimdo (comfy compiler pr) conflicts with New spare attention node PR (from kijay) - MINIMAX H3 VIDEO GENERATION
Actual Behavior:
OOM and crash when i use this with new Blocksparse attention node from kijay (int 8 sol attention)
with Blocksparse attention: at step 1 (spare attention still NO active)
after step 5: ( sparse attention node activates) and the memory increases gradually and then OOMs
主要报错形式为逐步采样时显存逐渐上升并最终触发 OOM 崩溃,非单一报错信息。
原因分析
用户根据现象推测:Comfy Compiler(Aimdo)会录制类 CUDA Graph 内容并重放。当稀疏注意力(Sparse Attention)替换节点被插入时,该路径被识别为不同分支,Comfy Compiler 为每一步创建多个分支,导致显存逐步堆积最终触发 OOM。该猜测目前未被代码层面完全证实,但从多个测试结果看高度吻合。
另一份用户验证:设置 start_percent=0 让 Sparse Attention 节点一开始就激活,内存仍在随步骤增长并最终 OOM,说明并非“中途启用导致分支切换”的问题,而是 Compiler 与稀疏节点之间存在更深层的显存分配和缓存/重放逻辑冲突。禁用 Comfy Compiler(--disable-comfy-compiler)后内存利用率低至 5.7GB/8GB 且没有泄漏,进一步佐证了冲突源在 Comfy Compiler 侧。
环境排查
- ComfyUI 版本:应升级至最新 GitHub master 以包含相关修复 PR #16148。
- Comfy Compiler(Aimdo/AimDo)版本:检查是否 0.5.2,以及 Upgrade 后是否包含针对 Sparse Attention 的修复。
- kijay 的 Blocksparse / Sparse Attention 节点及 INT8 Sol attention 版本。
- MiniMax H3 Chunk FeedForward(KJNodes)版本。
- PyTorch / CUDA:确认 Torch 2.13 + CUDA 13.0(必要时可测试回退版本看是否有差异)。
- 可检查是否存在
comfy kitchen attention的ModelAttentionBackend节点(如果工作流中引入了,则会影响注意力后端选择)。
解决步骤
- 先确认是否为 Comfy Compiler 与 Sparse Attention 的兼容冲突:在启动命令中添加
--disable-comfy-compiler参数,再跑同一工作流。预期:不再 OOM,显存占用明显回落(实测约 5.7/8GB)。若问题消失,可确认冲突源在 Comfy Compiler 侧。 - 尝试官方修复:同步拉取 Comfy-Org/ComfyUI 最新 master,确保包含 PR #16148 的修复(该 PR 已被用户在 Issue 中确认可修复此问题)。如有需要,可手动 cherry-pick 或等待官方发布包含该修复的版本。
- 临时规避(可优先尝试,二选一即可):若不想禁用整个 Comfy Compiler,可尝试在运行时不启用 Sparse Attention 节点(如
blocksparse旁路),或将 Sparse Attention 激活百分比调整到适合范围(如start_percent=0.2)以验证在特定配置下是否可避开崩溃窗口。 - 如果升级后仍存在问题:关注 相关 Issue #16150 的修复状况,确认是否为同一类问题,并可在 ComfyUI 官方 GitHub 追加复现信息。
验证方法
重新运行相同的 MiniMax H3 视频生成工作流,观察以下指标:
- 在 Sparse Attention 节点激活后(约第 5 步)显存是否仍持续攀升;应保持稳定或平稳波动。
- 完成整个生成过程,确认不再出现 OOM 崩溃(对比之前约第 13–17 步会 OOM 的情况)。
- 使用
--disable-comfy-compiler时,显存最高约 5.7GB/8GB(对比之前 8GB 满载再 OOM)。
参考来源
Comfy-Org/ComfyUI #16144
Comfy-Org/ComfyUI PR #16148(该 PR 修复了此问题)
相关问题 Issue #16150
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。

![[Go] Ollama: multimodal/vision requests drop images (no vision support)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/17332-b01d4185-768x403.jpg)
