快速结论:该报错发生在 ComfyUI 使用 comfy-kitchen attention 加速 MiniMax H3 int8 模型推理时,源于 int8 量化路径对 Q/K 张量的内存对齐要求未被满足。优先确认 ComfyUI 是否已升级到 0.33.0 或更高版本,该版本已修复此问题。
适用环境:Issue 中确认的环境为 Windows 便携版 ComfyUI 0.31.0,Python 3.11.8,PyTorch 2.9.1+cu130,NVIDIA GeForce RTX 3060,comfy-kitchen 0.2.30。另有用户反馈在 torch 2.9.0+cu130、RTX 3090 上同样复现。
最快修复方案:将 ComfyUI 升级到 0.33.0 或更高版本。Issue 作者已确认升级后问题得到解决。
注意事项:社区提供的 `attention.py` 临时补丁(对 batch size 为 1 的张量强制 contiguous)并非通用解决方案——有用户在 RTX 3090 上测试后反馈无效,仅建议作为临时尝试。
问题场景
用户在使用 ComfyUI 加载 MiniMax H3 int8 量化模型时,通过 SamplerCustomAdvanced 节点运行采样,启用 comfy-kitchen attention 加速后触发报错。使用 Sage-Attention 时一切正常,问题仅在 comfy-kitchen 的 int8 路径中出现。
报错原文
RuntimeError: quant_qk_per_thread_int8: Q/K base pointers and B/H/N strides must preserve 4-element alignment
原因分析
该报错来自 int8 量化 attention 的内核实现,要求 Q/K 张量的基础指针、batch/head/sequence 维度步长必须满足 4 元素内存对齐。可能是 ComfyUI 在 int8 推理链路中对 Q/K 张量做了转置或 reshape 后产生了非连续(non-contiguous)内存布局,破坏了内核的对齐假设;也可能是 comfy-kitchen 0.2.30 与 ComfyUI 0.31.0 之间的 int8 接口不兼容。社区临时补丁只在特定 batch size 下有效,说明是通用修复而非个别环境问题。
环境排查
- 确认 ComfyUI 版本是否为 0.33.0 或更高(Issue 反馈该版本已包含修复)。
- 确认 PyTorch 版本及 CUDA 构建(受影响用户为 2.9.0/2.9.1 + cu130)。
- 确认 comfy-kitchen 版本(受影响版本为 0.2.30)。
- 记录显卡型号(RTX 3060 和 RTX 3090 均可复现,并非特定显卡问题)。
解决步骤
- 首选:升级 ComfyUI —— 将 ComfyUI 升级到 0.33.0 或更高版本,该版本已确认修复此问题。
- 临时方案(可优先尝试):编辑
comfy\ldm\modules\attention.py,在_comfy_kitchen_int8_inputs函数中,于 mask 处理之前加入以下代码片段,强制 batch size 为 1 时 Q/K/V 张量连续:if b == 1: q, k, v = (t if t.is_contiguous() else t.contiguous() for t in (q, k, v))注意:此补丁为社区“vibe fix”,未经过完整验证,有用户反馈在 RTX 3090 上无效。
- 降级使用替代方案:在问题修复前,可暂时改用 Sage-Attention 替代 comfy-kitchen attention 完成推理。
验证方法
升级或应用补丁后,重新加载 MiniMax H3 int8 模型并运行同一工作流(可通过禁用所有自定义节点、仅保留基础工作流来缩小排查范围)。若 SamplerCustomAdvanced 节点能正常完成采样且无该 RuntimeError 报错,即说明问题已解决。建议同时对比 int8 与普通精度模型的推理输出,确认画质无异常。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


