分类: AI 工具排错

Model Sparse attention node OOM on MMH3

Model Sparse attention node OOM on MMH3

该报错通常出现在 MiniMax H3 模型启用官方核心节点「Model Sparse Attention」时,因显存分配超限导致 OOM,优先排查 ComfyUI 内置的 comfy-compiler 优化是否出错,可尝试以 --disable-comfy-compiler 参数启动验证。

[RFC]: Partial Cache Hits for Hybrid Models

[RFC]: Partial Cache Hits for Hybrid Models

该 RFC 讨论的是 vLLM 在混合架构模型(Full Attention + Mamba)中,由于 Mamba 状态块大小过大导致前缀缓存命中粒度变粗的问题。优先排查方向并非“修复报错”,而是评估是否引入 hash_block_size 配置以实现部分缓存命中(Partial Cache Hit