macOS app 0.34: UI hangs because ChatGPT/Codex detection runs osascript on the main thread

该问题通常出现在 macOS 上运行 Ollama 桌面应用 0.34.x(含 0.34.1、0.34.2,以及 0.34.3-rc1)时,应用启动后会卡死甚至让整个系统失去响应。优先排查方向不是 MLX 或模型加载,而是应用启动时对 ChatGPT/Codex 的检测逻辑在主线程上执行 osasc

该问题通常出现在 macOS 上运行 Ollama 桌面应用 0.34.x(含 0.34.1、0.34.2,以及 0.34.3-rc1)时,应用启动后会卡死甚至让整个系统失去响应。优先排查方向不是 MLX 或模型加载,而是应用启动时对 ChatGPT/Codex 的检测逻辑在主线程上执行 osasc

这个报错通常出现在 MiniMax-H3 视频 VAE 解码阶段,当 VAE 处于部分 offload 状态、 qk_norm_scale 停留在 CPU 而上游张量在 CUDA/ROCm 设备上时触发。优先排查 VAE 是否被部分卸载,以及 qk_norm_scale 与 query 的设备是否一

这个报错通常出现在用 llama-server 跑 MiMo-V2.6-Distill-Qwen-9B(GGUF)并调用 OpenAI 兼容 tools API 时,模型自带的 chat template 被误判为 Qwen3-Coder 模板,导致工具调用永远走不到正常结束。优先排查 llama.

该报错通常发生在 llama.cpp 使用 Vulkan 后端、开启多设备张量并行( -sm tensor )并加载模型时,进程在模型加载阶段触发 SIGSEGV;日志中会先出现 ggml-backend-meta: multi buffers are unsupported leading to

这个报错通常出现在 Linux 上使用 llama.cpp 的 SYCL 后端搭配 Intel Arc A770 启动 llama-server / llama-cli 时,启动阶段在获取设备显存大小失败后触发 ggml_abort 并 core dump。优先排查 SYCL 构建是否缺少 Inte
![[Bug][ROCm/gfx942]: DeepSeek-V4-Flash silent retrieval corruption for prompts ≥ ~4-5k tokens (AITER sparse indexer)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/52109-0c477c70-768x403.jpg)
这类静默检索损坏通常出现在 ROCm/gfx942 上运行 DeepSeek-V4-Flash/Pro 并启用 AITER 稀疏索引器(DSA indexer)的长上下文场景中;当压缩后的候选 token 超过 index_topk 、开始真正发生 top-k 选择后,服务器不会报错,但 needl

这个 bug 通常出现在 Open WebUI 的 Settings > Account 页面:点击 JWT token 或 API key 旁边的复制图标时,除了复制内容,还会顺带提交并保存整个 Account 表单,导致尚未保存的个人资料修改被写入,并弹出 “Settings saved suc

该问题通常出现在使用 AutoProcessor.apply_chat_template 处理多模态对话(图文混合)且开启 return_assistant_tokens_mask=True 时,返回的 assistant_masks 全为 0,需要优先排查多模态占位符展开导致的字符索引错位。核心英

当你在 Transformers 中用 ViTMAEForPreTraining 预训练 MAE 并尝试开启 Flash Attention 2.0 时,会直接抛出不支持的错误;优先确认 Transformers 版本是否已升级到 v4.50.0 或更高,并检查 attn_implementatio

当你在 Ollama 中通过 top_logprobs 请求超过 20 个候选 token 时,请求会在进入后端前被 Ollama 自己的请求校验拦截,报错信息为 top_logprobs is capped at 20, but nothing downstream requires that 。