Eval bug: Speculative Decoding intermittent timeout

用户在 llama.cpp 的 llama-server 中启用 Vulkan 后端,配合 AMD 显卡运行 Qwen3.6-35B-A3B-UD 模型,并设置了推测解码参数(包括 MTP 和 ngram-mod 模式)。问题通过 llama-swap 调用时被观察到,表现为流式输出突然暂停、连接持

用户在 llama.cpp 的 llama-server 中启用 Vulkan 后端,配合 AMD 显卡运行 Qwen3.6-35B-A3B-UD 模型,并设置了推测解码参数(包括 MTP 和 ngram-mod 模式)。问题通过 llama-swap 调用时被观察到,表现为流式输出突然暂停、连接持

用户在 Linux 系统上编译 llama.cpp 的 Vulkan 后端时触发问题。使用 Nix 构建系统(`nix flake update && nix build '.#vulkan'`)或其他构建系统均可复现。当 shaderc 版本为 v2025.2(nixos-unstable 中的最
![[Bug]: V1 Engine Produces Incorrect Scores for Qwen3-Reranker-0.6B on Long Sequences (>8K tokens)](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48831-406cb7a1-768x403.jpg)
用户在 vLLM V1 引擎上使用 Qwen3-Reranker-0.6B 模型进行 rerank 评分时,当输入序列长度超过 8K tokens,返回的分数不正确。离线调用 LLM.score() 看起来正常,但在线部署时复现。环境为 Ubuntu 22.04 + PyTorch 2.11.0 +

用户在 vLLM v0.25.0 Docker 环境中,使用 vllm serve 命令加载 MiniMax-M3-W4A16-GPTQ 等 W4A16 INT4 量化模型时触发。启动命令包含 --tensor-parallel-size 4 ,并启用了 chunked prefilling 和 p

Linux 创始人 Linus Torvalds 在邮件列表中明确表态,支持在 Linux 内核开发中使用 AI 工具,并强硬回击了社区内的反对声音。这一立场直接为 Linux 基金会旗下的 AI 代码审查系统 Sashiko 扫清了意识形态障碍。

用户在 Windows 系统(NVIDIA GPU + AMD CPU)上使用 Ollama 0.30.7 运行 Phi4 模型时触发。复现方式包括命令行运行 ollama run phi4 以及调用 /api/chat 端点。

美国伊利诺伊大学厄巴纳-香槟分校(UIUC)开发了一套名为“AI教学助手”的开源系统,能够在电气工程课程中,并行运行11个模型完成文本、图像检索、生成、审核和排序,实现2秒内回复。这套系统旨在通过检索增强生成(RAG)和基于人类反馈的强化学习(RLHF),为学生提供高质量的多媒体问答服务,但受到教材版权和数据…

ReasonGate 是一个出现在 Hacker News “Show HN” 栏目上的新项目,它提出了一种名为“可解释门控”的方案,旨在拦截针对大语言模型的提示注入攻击。这个项目的出现,为 LLM 安全防护提供了一个可能替代传统黑名单的、更具可解释性的方向。

白宫提词器助理加布里埃尔·佩雷斯被指利用职务之便,在预测市场Kalshi上下注特朗普演讲中会出现的单词和短语,获利约10万美元,交易有时甚至发生在演讲进行中。事件暴露了预测市场在政府信息透明度与内幕交易监管上的巨大漏洞。

用户使用 llama.cpp 编译版(version: 9997, cb489bc0f, WebUI 9986),在聊天面板中关闭一个已添加的 MCP 服务器,随后发现该 MCP 服务器在新建聊天中消失,且在设置中的 MCP 服务器列表变为空。