[ISSUE]: TextGen Fails to load GGUF models on multiple browsers, different textgen versions.
![[ISSUE]: TextGen Fails to load GGUF models on multiple browsers, different textgen versions.](https://www.chat-gpts.plus/wp-content/uploads/2026/09/7530-3d63106e-768x403.jpg)
这个报错通常出现在 Ubuntu 桌面环境下用 TextGen WebUI 或 Linux 便携包(Electron 桌面版)加载 GGUF / mmproj 模型时,前端 GUI 能打开但模型加载进程崩溃或提示加载失败。优先排查 Electron 启动链路与本地 build 版本(4.7.x)是否
![[ISSUE]: TextGen Fails to load GGUF models on multiple browsers, different textgen versions.](https://www.chat-gpts.plus/wp-content/uploads/2026/09/7530-3d63106e-768x403.jpg)
这个报错通常出现在 Ubuntu 桌面环境下用 TextGen WebUI 或 Linux 便携包(Electron 桌面版)加载 GGUF / mmproj 模型时,前端 GUI 能打开但模型加载进程崩溃或提示加载失败。优先排查 Electron 启动链路与本地 build 版本(4.7.x)是否

在使用 llama.cpp 的 Hexagon HTP 后端执行 F32/F16 的 GGML_OP_ADD 时,如果 src1 的 dim 1 为 1、同时在 dim 2 上有多个 slice(即按行广播但跨 dim 2 切片),HTP 内核可能读错行,导致输出出现 FLT_MAX / inf 。
![Misc. bug: Vulkan ARGSORT ne=[2048,1,1,1] only sorts half of the array on some devices](https://www.chat-gpts.plus/wp-content/uploads/2026/09/29431-0e9cbdaa-768x403.jpg)
这个报错通常出现在支持较大 workgroup(例如 2048 invocations)的 Vulkan 设备上,运行 llama.cpp 的 ARGSORT 后端测试时,数组只被排序了一半。优先排查 ggml_vk_argsort() 中 use_small 路径是否在 ne0=2048 时被错误
![[Bug] Qwen4Exp QSA indexer: per-chunk logits buffer grows with max_seq_len, caching allocator keeps every size, device OOM/hang on unified-m](https://www.chat-gpts.plus/wp-content/uploads/2026/09/56457-d01dde83-768x403.jpg)
该报错通常出现在 GB10(SM121)、unified memory 机器上用 vLLM 跑 Qwen4Exp 架构模型做超长 prefill(chunked prefill)时,随着 chunk 推进,QSA indexer 的 per-chunk logits buffer 尺寸逐块增大,Py
![[Bug]: Batch invariance is broken when sequence parallelism / async TP is enabled (`VLLM_BATCH_INVARIANT=1` + `pass_config.enable_sp`)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/56370-536c0b3f-768x403.jpg)
在 vLLM 中同时启用 VLLM_BATCH_INVARIANT=1 与 pass_config.enable_sp=True (或会隐式开启它的 fuse_gemm_comms=True )时,相同请求的 logprobs / 贪心输出会随 batch 组成变化,批量不变性被破坏;优先排查是否同
![[Bug] V1 InputBatch condense can leak stale allowed_token_ids mask to recycled row](https://www.chat-gpts.plus/wp-content/uploads/2026/09/43894-a55fb008-768x403.jpg)
该报错通常出现在 vLLM V1 引擎开启动态批处理、同时混用带 allowed_token_ids 受限请求与无限制请求时, InputBatch.condense() 会把已释放行的 stale allowed_token_ids_mask_cpu_tensor 残留下来,并被后续无限制请求复用
![[Bug] V1 InputBatch condense can leak stale allowed_token_ids mask to recycled row](https://www.chat-gpts.plus/wp-content/uploads/2026/09/43894-a55fb008-768x403.jpg)
该报错通常出现在 vLLM V1 引擎开启动态批处理、同时混用带 allowed_token_ids 受限请求与无限制请求时, InputBatch.condense() 会把已释放行的 stale allowed_token_ids_mask_cpu_tensor 残留下来,并被后续无限制请求复用

该问题通常出现在客户端把包含 tool 角色的消息历史(例如 system → user → assistant → tool → assistant 的连续对话)提交给 Ollama 时,Ollama 返回 invalid request 并拒绝 tool 角色,而同一 GGUF 模型在 llam

XTransfer 高级技术总监陈忻将在 10 月 22 日—24 日举办的 QCon 上海站分享 B2B 跨境支付风控的 AI 工程实践,提出“可控、可测、可进化”的三层 AI 工程飞轮,把 AI 从辅助工具推进到可审核、可观测、可归因的生产系统。

KDE 社区尝试为 LLM 辅助贡献制定使用规范,讨论却因大量非 KDE 成员涌入争吵 AI 伦理而被迫撤下;GNOME 开发者 Jordan Petridis 则提出更严格的草案,主张禁止 LLM 生成或修改提交到 GNOME 的任何内容。这场争议反映出开源项目正被迫为 AI 贡献划定边界。