Flash/Sage varlen does not work with torch.compile

当你在 Diffusers 的 Flux 注意力处理器中启用 Flash/Sage varlen(变长)注意力并叠加 torch.compile 时,varlen 实现为在运行时推导最大序列长度会触发 Tensor.item() ,被 Dynamo 判定为 Graph break,从而无法完整编译。

当你在 Diffusers 的 Flux 注意力处理器中启用 Flash/Sage varlen(变长)注意力并叠加 torch.compile 时,varlen 实现为在运行时推导最大序列长度会触发 Tensor.item() ,被 Dynamo 判定为 Graph break,从而无法完整编译。
![[Bug] Ascend NPU: RMSNorm crashes with elementwise_affine=False; _native_npu FA rejects [B, N, 1, Skv] masks (LTX-2)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/14380-1858c464-1-768x403.jpg)
在 Ascend NPU 上运行 LTX-2(例如 LTX-2.3 LoRA FlowGRPO 训练)并使用 attn_backend=_native_npu 时,会遇到两个 NPU 兼容性报错:一是 RMSNorm 在 elementwise_affine=False 时把 weight=None

在 Diffusers 的 QwenImage21Pipeline 里做图像编辑(image editing)时,若把 output_resolution 设为默认的 1024,会出现编辑指令被忽略、输出变成带光环(halo)的过度锐化近似原图;把目标分辨率降到 512/768(部分环境 864/8
![[Bug]: Drop down menu of ´Add Lora to prompt´ does nont have a ´none´ selection and always charge the last Lora selected](https://www.chat-gpts.plus/wp-content/uploads/2026/09/9041-6fefaf96-768x403.jpg)
当你在 Stable Diffusion WebUI 的 Settings 中启用 sd_lora 后,底部“Add Lora to prompt”下拉菜单没有 None /空白选项,导致每一次生成都会强制带上上一次选中的 Lora;如果这个 Lora 文件是空文件或损坏文件,还会在激活时抛出 Sa

该报错通常出现在 Linux 上首次运行 Stable Diffusion WebUI 的 webui.sh 安装脚本时,脚本无法生成或激活项目目录下的 Python 虚拟环境(venv)。优先排查系统是否真正装好 python3-venv / virtualenv ,以及 venv/ 目录是否被正

这个报错通常出现在 Stable Diffusion WebUI 的“生成”按钮、提示词清理按钮、保存/应用按钮点击无响应,浏览器前端 JS 报错时;优先排查 Gradio 前端静态资源是否完整、是否损坏,以及 Gradio 版本是否与 WebUI 版本匹配。

当你已经配好 OpenAI 兼容的 FLUX 图片生成端点、Playground → Images 能出图,但普通聊天里看不到 Image/Image Generation 入口、模型只把 dalle.text2im 当纯文本吐出来时,先把排查重点放在聊天输入框的 Integrations 菜单里

当你在 Transformers 里对多模态对话(含 image/video/audio)调用 apply_chat_template 并开启 return_assistant_tokens_mask=True 时,如果图像占位 token 被展开,assistant mask 会全为 0,优先排查

当你用 ViTMAEForPreTraining 做 MAE 预训练并尝试启用 Flash Attention 2.0 时,旧版 Transformers 会在模型加载阶段直接抛出该错误;优先确认 Transformers 版本是否已包含对应的 ViT attention 重构。

当你在 Ollama 上运行 Gemma 4 系列模型做 OCR、文档解析或读取小字号文本时,如果发现识别结果缺字、串字、准确率明显下降,通常不是模型本身质量问题,而是 Ollama 把图像 token 预算 max_soft_tokens 硬编码为 280 ,导致高分辨率视觉任务细节丢失。优先排查