ASR example doesn’t save tokenizer settings

这个报错通常出现在用 run_speech_recognition_ctc.py 训练 ASR 模型并推送到 Hub 之后,下载回训练好的模型做推理时,发现仓库里缺少 tokenizer 相关文件(如 tokenizer_config.json 、 vocab.json 等)。优先排查脚本里传给 T

这个报错通常出现在用 run_speech_recognition_ctc.py 训练 ASR 模型并推送到 Hub 之后,下载回训练好的模型做推理时,发现仓库里缺少 tokenizer 相关文件(如 tokenizer_config.json 、 vocab.json 等)。优先排查脚本里传给 T
![[Bug] Ollama hardcodes Gemma 4 image token budget (max_soft_tokens=280), breaking OCR on high-resolution images](https://www.chat-gpts.plus/wp-content/uploads/2026/09/17152-d9c601c0-1-768x403.jpg)
这个报错通常出现在用 Ollama 的 Gemma 4 视觉模型(gemma4)做 OCR 或读屏截图识别时:模型对 1920x1080 等高分辨率图片返回“没有可识别文字”或产生幻觉,而同一张图在 llama.cpp / HuggingFace 下正常。优先排查 Ollama 的图片预处理是否把图

该报错通常出现在 TextGen WebUI 以 GPTQ 4bit 方式加载 LLaMA 系列模型时,底层 GPTQ-for-LLaMa 的 llama.py 需要从 transformers 中导入 LlamaConfig / LlamaForCausalLM (或旧写法 LLaMAConfig

当你在 Diffusers 的 Flux 注意力处理器中启用 Flash/Sage varlen(变长)注意力并叠加 torch.compile 时,varlen 实现为在运行时推导最大序列长度会触发 Tensor.item() ,被 Dynamo 判定为 Graph break,从而无法完整编译。

在 Diffusers 的 QwenImage21Pipeline 里做图像编辑(image editing)时,若把 output_resolution 设为默认的 1024,会出现编辑指令被忽略、输出变成带光环(halo)的过度锐化近似原图;把目标分辨率降到 512/768(部分环境 864/8

当你在 Transformers 里对多模态对话(含 image/video/audio)调用 apply_chat_template 并开启 return_assistant_tokens_mask=True 时,如果图像占位 token 被展开,assistant mask 会全为 0,优先排查

当你用 ViTMAEForPreTraining 做 MAE 预训练并尝试启用 Flash Attention 2.0 时,旧版 Transformers 会在模型加载阶段直接抛出该错误;优先确认 Transformers 版本是否已包含对应的 ViT attention 重构。

当你在 Ollama 上运行 Gemma 4 系列模型做 OCR、文档解析或读取小字号文本时,如果发现识别结果缺字、串字、准确率明显下降,通常不是模型本身质量问题,而是 Ollama 把图像 token 预算 max_soft_tokens 硬编码为 280 ,导致高分辨率视觉任务细节丢失。优先排查

该问题通常出现在使用 AutoProcessor.apply_chat_template 处理多模态对话(图文混合)且开启 return_assistant_tokens_mask=True 时,返回的 assistant_masks 全为 0,需要优先排查多模态占位符展开导致的字符索引错位。核心英

当你在 Transformers 中用 ViTMAEForPreTraining 预训练 MAE 并尝试开启 Flash Attention 2.0 时,会直接抛出不支持的错误;优先确认 Transformers 版本是否已升级到 v4.50.0 或更高,并检查 attn_implementatio