[Bug][KV Offload]: `on_request_finished()` has inconsistent guarantees across offloading layers
![[Bug][KV Offload]: `on_request_finished()` has inconsistent guarantees across offloading layers](https://www.chat-gpts.plus/wp-content/uploads/2026/06/46027-c3300fcd-768x403.jpg)
该问题由 vLLM 项目 #46027 报出,用户在使用 KV Offload 功能时(未指定模型、环境或具体运行配置),在进行请求驱动的缓存卸载/加载调度时触发。该 Bug 并非运行时崩溃,而是代码语义错误:两个 offloading 层级的 `on_request_finished` 提供了不一
![[Bug][KV Offload]: `on_request_finished()` has inconsistent guarantees across offloading layers](https://www.chat-gpts.plus/wp-content/uploads/2026/06/46027-c3300fcd-768x403.jpg)
该问题由 vLLM 项目 #46027 报出,用户在使用 KV Offload 功能时(未指定模型、环境或具体运行配置),在进行请求驱动的缓存卸载/加载调度时触发。该 Bug 并非运行时崩溃,而是代码语义错误:两个 offloading 层级的 `on_request_finished` 提供了不一

Hacker News 用户和开发者社区近期密集讨论以 Haystack 为代表的轻量级、可插拔的开源 AI 框架,认为它有望成为“AI 界的 Flask”,平衡了 LangChain 的功能冗余与纯 DIY 的重复劳动,尤其适合中小团队快速构建生产级 RAG 与 AI Agent。

用户通过OpenAI-API-Compatible接口将本地部署的Embedding模型接入RAGFlow,但文档解析(Parsing)流程持续卡住,Embedding服务未收到任何请求。后台日志中显示模型文件路径错误。
![[Bug]: Apply “Table” to excel,abnormal llm behavior.](https://www.chat-gpts.plus/wp-content/uploads/2026/06/5850-d237fdbd-768x403.jpg)
用户在使用 RAGFlow v0.17.0-29(commit ID: g555c7067)创建知识库时,选择了“Table”模式来解析 Excel 电子表格文件。随后,用户配置了一个聊天机器人(Chatbot),使用 deepseek-r1 模型,并关联该知识库。用户在提问时发现,模型直接输出数据

用户在 Android 设备(Snapdragon,Hexagon HTP v73)上,使用 llama.cpp (version 9775, built with Clang 21.0.0 for Android aarch64) 的 llama-completion 工具加载 Qwen3-4B

Anthropic 正式推出 Claude Tag,一款深度嵌入 Slack 的企业协作工具。它将 Claude 从个人对话助手升级为“能主动工作、持续协作的团队智囊”,以共享上下文、持续记忆和主动介入为核心卖点。Andrej Karpathy 将这次升级称为 LLM 用户界面的“第三次变革”。

AI 的能力边界正在快速外扩——PingCAP CTO 黄东旭与团队仅用三个月、一两个人、约 2000 美元 token 成本,就在 AI 辅助下完成了 100 多万行代码的数据库项目,且全程未遇到 AI 无法推进的瓶颈。这打破了以往“复杂软件 AI 写不了”的预判,同时也提醒:真正稀缺的不是写代码的能力,而…
![[Bug]: Minimax m3 reasoning parser sending in content field in streaming](https://www.chat-gpts.plus/wp-content/uploads/2026/06/45687-72007dad-768x403.jpg)
用户使用 vLLM(标签 minimax-m3 )部署 MiniMax M3 模型,并同时启用 --tool-call-parser minimax_m3 和 --reasoning-parser minimax_m3 。在非流式模式下,推理解析器正常工作;但在 streaming 模式下, <mm
![[Bug]: RPC call to sample_tokens timed out. Qwen3.5-397B-A17B](https://www.chat-gpts.plus/wp-content/uploads/2026/06/35496-ef53c44d-768x403.jpg)
用户在 NVIDIA H200 GPU 上部署 Qwen3.5-397B-A17B 模型,遵循官方部署指南(https://github.com/vllm-project/recipes/blob/main/Qwen/Qwen3.5.md),使用 8 张 GPU 并启用了 tensor_parall

用户在 Open WebUI v0.8.12(Docker 部署,Debian 13)中配置了推理模型(如 kimi-k2.5 通过 Moonshot API 或 OpencodeGO 提供商),启用了本地函数调用( function_calling: native )和至少一个工具(如网络搜索、代