快速结论:该报错通常发生在 Linux 系统 + AMD APU(如 Ryzen 8700G)使用集成显卡运行 ComfyUI 时,加载大模型会出现约 2 倍的内存占用(系统 RAM 与 GTT 共享内存各存一份)。优先尝试在启动命令中同时添加 --enable-dynamic-vram 和 --fast-disk 两个参数组合来解决。
适用环境:ComfyUI,Linux 系统,AMD APU 集成显卡(如 Ryzen 8700G),ROCm 环境(需安装 gfx110X 系列 nightly 版 torch/torchvision/torchaudio 以及可选 Triton)。
最快修复方案:在 ComfyUI 启动命令中同时添加 --enable-dynamic-vram 和 --fast-disk 参数。Issue 中明确验证:单独使用任何一个参数都无法解决内存占用过高的问题,只有两者组合使用时才有效。
注意事项:该方案只能解决 AMD APU 场景下的内存占用过高/OOM/抖动问题,不会降低模型加载后的整体内存占用(加载 19.1 GiB 模型后仍有约 15 GiB 空闲 RAM,VAE 解码时约 12 GiB)。此外 Issue 中提到 --enable-dynamic-vram 在 AMD 上仍存在一些未解决的问题,属于经验性修复而非底层根因修复。
问题场景
在 Linux 系统上使用 AMD APU(例如 Ryzen 8700G)的集成显卡运行 ComfyUI,通过 “Load Diffusion Model” 或 “CLIPLoader” 节点加载模型时触发。用户必须使用集成显卡而非独立显卡,且建议安装 ROCm gfx110X nightly 版 PyTorch。以 z_image_int8_convrot.safetensors(模型约 6GiB)为例,加载后内存占用约 14GiB;更大的 qwen_image_edit_2511_int8_convrot.safetensors(19.1GiB)在 48GiB 总内存 + 36GiB GTT 环境下直接 OOM 或触发严重磁盘抖动。
报错原文
2x memory footprint when loading a model on AMD APU system
z_image_int8_convrot.safetensors --> consumes ~14GiB.
qwen_image_edit_2511_int8_convrot.safetensors --> OOM/thrashing on 48 GiB total RAM, with 36 GiB GTT size.
原因分析
可能原因是 AMD APU 的统一内存架构(unified memory architecture)导致模型被加载两次:一份存在于系统 RAM 中,另一份存在于 GTT(Graphics Translation Table)共享内存块中,从而出现接近 2 倍的内存占用。Issue 中指出 GGUF 节点通过 mmap 方式加载模型时内存占用正常,推测问题可能与 ROCm/TheRock 的内部内存管理或 ComfyUI 对 AMD 内存分配的处理方式有关。另外,与 ComfyUI 量化节点(如 int8_convrot)配合的 comfy-kitchen 后端在 ROCm 环境下的内存管理也可能存在问题。
环境排查
- 操作系统:Linux(Issue 强调必须是 Linux 系统)
- 硬件:AMD APU 集成显卡(例如 Ryzen 8700G),不使用独立 GPU
- PyTorch:安装 ROCm gfx110X nightly 版
pip install --index-url https://rocm.nightlies.amd.com/v2/gfx110X-all/ --pre torch torchvision torchaudio - 可选依赖:Triton(用于加速内核)
pip install --upgrade --index-url https://rocm.nightlies.amd.com/v2/gfx110X-all/ --pre triton - 确认已禁用自定义节点,排除自定义节点干扰
解决步骤
- 首先确认当前环境是 Linux + AMD APU 集成显卡,并已正确安装上述 ROCm nightly 版 PyTorch。
- 在 ComfyUI 启动命令中同时添加两个参数:
--enable-dynamic-vram --fast-disk。 - 若之前单独使用过
--enable-dynamic-vram或--fast-disk但效果不佳,请务必同时使用两者组合,Issue 已确认单独使用均无法解决内存占用过高的问题。 - 如果问题依然存在,可优先尝试更新 ROCm 驱动或切换不同版本的 nightly PyTorch,但 Issue 中未验证这些方案的最终效果。
验证方法
加载 qwen_image_edit_2511_int8_convrot.safetensors(约 19.1GiB)后,系统空闲内存应保持在 15GiB 左右,VAE 解码时保留约 12GiB 空闲内存,不再出现 OOM 或严重磁盘抖动。同时对比加载模型前、加载后以及 VAE 解码期间的空闲 RAM 变化,确认内存占用从接近 2 倍模型大小回落到模型大小 + 合理开销的水平。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


