Misc. bug: Very slow prompt cache update process.

用户运行 llama-server 作为后端服务(服务 OpenCode 等前端),使用 --cache-ram (如 16384 或 65536 MB)及 --kv-unified 、 --parallel 、 --cache-reuse 等配置。当出现多 agent / sub-agent 并发

用户运行 llama-server 作为后端服务(服务 OpenCode 等前端),使用 --cache-ram (如 16384 或 65536 MB)及 --kv-unified 、 --parallel 、 --cache-reuse 等配置。当出现多 agent / sub-agent 并发

用户运行 llama-server ,为带有 DSpark draft 头的 Bonsai-27B 模型( --spec-type draft-dspark )进行投机解码,并将主模型上下文设置为 32768( -c 32768 ),同时将 draft 模型完全卸载到 GPU( -ngld 99 )

用户在使用 vLLM 部署 Qwen3-VL-235B 模型,处理多图片、长序列、多轮对话输入时触发 OOM。环境为 8×H100 80GB,运行 Ubuntu 24.04,PyTorch 2.10.0+cu129,CUDA 12.9。
![[CI Failure]: Repo-wide job failures from HuggingFace Hub 504 outage (model downloads)](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48830-f484f4ab-768x403.jpg)
vLLM CI 构建(Build #78354,对应 PR #48150)中,多个无关测试套件同时出现失败,包括 basic-correctness 、 language-models-tests-standard 、 entrypoints-integration-api-server-gener

Kit For AI 今日在 Product Hunt 上线,定位为 AI 智能体的“记忆层”。它提供持久化记忆和接地知识(grounded knowledge),让开发者只需通过一个 API 就能让 AI 调用原生 MCP 工具,跳过搭建和维护 RAG 系统,目前免费可用。

Hacker News 上一篇高赞讨论点出了 LLM 使用者的核心矛盾:批评者担心长期依赖 LLM 会导致软件工程等领域的“思维肌肉”萎缩,但使用者自己确实体验到了效率提升和学习加速。这场争议不是简单的对错之争,而是每个人都要面对的生产力与能力投资的取舍问题。

Google 在 Gemini Enterprise Agent Platform 中原生集成了 Parallel Web Systems 的搜索能力,使 AI Agent 在回答复杂任务时能直接引用高时效性的网络搜索结果,并支持精确的源引用标注。

Hugging Face 披露了一起由自治 AI 代理系统驱动的生产环境入侵事件,这是首次公开确认的“AI 攻击 AI”安全事件;攻击链始于恶意数据集,而防御方同样依靠 AI 工具完成分析响应,揭示了新一代攻防不对称局面。
![[Bug]: MinerU parser ignores split page ranges and duplicates chunks](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16586-2c6a0a8a-768x403.jpg)
用户在使用 RAGFlow v0.26.2(commit 62f94cd5)搭配 Docker Compose 部署,配置 MinerU 作为 PDF 解析器(通过 MinerU API 服务)。上传一份超过单次解析页数限制的 32 页 PDF(含多张图片),RAGFlow 自动将文档拆分为多个页范
![[Bug]: MinerU parser reparses the entire PDF for every page-splitting task, causing duplicate computation and poor performance](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16971-71c00ea7-768x403.jpg)
用户在 RAGFlow (commit cb93883, v0.26.4, Ubuntu 22.04) 中配置 MinerU 解析器,上传一个数百页的大 PDF 文件,启动文档解析任务时触发。