Misc. bug: Webui causing high CPU load in Firefox

该问题出现在使用 llama.cpp 的 llama-server 运行推理速度约 100 T/s 的 reasoning 模型时,前端 Firefox 打开 WebUI 并生成较长的 reasoning 输出,导致客户端 Firefox 占用 100% 单核 CPU。优先排查方向是 WebUI 前

该问题出现在使用 llama.cpp 的 llama-server 运行推理速度约 100 T/s 的 reasoning 模型时,前端 Firefox 打开 WebUI 并生成较长的 reasoning 输出,导致客户端 Firefox 占用 100% 单核 CPU。优先排查方向是 WebUI 前
![[Bug]: --otlp-traces-endpoint initializes tracer but never sends spans (instrument_otel/manual_instrument_otel never invoked)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/56696-8c43ad90-768x403.jpg)
在 vLLM 启动时传入 --otlp-traces-endpoint (可选叠加 --collect-detailed-traces all )后,服务能正常推理、Prometheus 指标正常,但 OTLP 端点始终收不到任何 span,日志里也没有报错。通常发生在 vLLM 已 fork 出

亚马逊科学家在 2026 年 9 月 10 日发布研究指出,LLM 驱动的机器学习研究 Agent 反复在同一基准上迭代却不会过拟合,原因是它们学到的是高度可压缩的策略,而非记住数据。这项工作给"基准刷榜是否等于真实进步"这个老问题提供了可实验的解释。

Hacker News 上出现了一个名为 StemJSON 的声明式语言,试图让大模型直接生成原生移动应用的 UI 与逻辑,而不是生成代码片段。它把“AI 写 App”从生成文本推进到生成可被运行时校验、渲染的结构化模块,这一点值得关注。

一位开发者复盘了企业 AI 客服从上线即翻车到工程师愿意“先让它回”的三个月改造过程,核心结论是:垂类客服的瓶颈不在模型能力,而在系统缺少“概念边界”,需要用结构化知识层来兜住向量检索的模糊性。

阶跃星辰开放平台产品负责人陶炳哲将在 2026 年 QCon 上海站分享「双层评估 + 自动校准」的 LLM-as-Judge 闭环方案,让 Agent Loop 从「跑通一次」变成「连续跑对十次」。

这个报错通常出现在使用 VLLM_TARGET_DEVICE=empty 构建的 vLLM v0.20.2 上,而 v0.20.2 默认启用 V1 engine,V1 engine 的模型初始化会调用未编译进 empty 构建的 C++ 扩展,从而抛出 No module named 'vllm._

这个报错通常出现在多节点 TP 部署 hybrid GDN/mamba 模型并开启 --enable-prefix-caching 时:head 节点在进程内把 mamba_cache_mode 从 "none" 派生为 "align" ,但该派生值没有传达到远端 worker,导致两个 rank

该报错通常出现在 llama.cpp 的 llama-server 上,使用多槽位并发( -np 3 )并同时开启 --ctx-checkpoints 与 --cache-ram 时,随着运行时间增长主机内存被 checkpoint 缓存逐步吃满而触发 OOM。优先排查并调低或移除这两个缓存相关参数
![[Bug][ROCm]: DeepSeek V4 accuracy drops with MRV2 on MI350/MI355 when FULL_DECODE_ONLY graph](https://www.chat-gpts.plus/wp-content/uploads/2026/09/52644-e5cd4f06-768x403.jpg)
该问题出现在 ROCm 环境下的 vLLM 使用 DeepSeek V4 模型并启用 MRV2 时,若 Decode 阶段只走 FULL_DECODE_ONLY 图,会导致精度下降。优先排查 cudagraph/full decode 相关配置与 nightly 版本差异。