[Bug]: RPC call to sample_tokens timed out. Qwen3.5-397B-A17B
![[Bug]: RPC call to sample_tokens timed out. Qwen3.5-397B-A17B](https://www.chat-gpts.plus/wp-content/uploads/2026/06/35496-ef53c44d-768x403.jpg)
用户在 NVIDIA H200 GPU 上部署 Qwen3.5-397B-A17B 模型,遵循官方部署指南(https://github.com/vllm-project/recipes/blob/main/Qwen/Qwen3.5.md),使用 8 张 GPU 并启用了 tensor_parall
![[Bug]: RPC call to sample_tokens timed out. Qwen3.5-397B-A17B](https://www.chat-gpts.plus/wp-content/uploads/2026/06/35496-ef53c44d-768x403.jpg)
用户在 NVIDIA H200 GPU 上部署 Qwen3.5-397B-A17B 模型,遵循官方部署指南(https://github.com/vllm-project/recipes/blob/main/Qwen/Qwen3.5.md),使用 8 张 GPU 并启用了 tensor_parall

用户在 Open WebUI v0.8.12(Docker 部署,Debian 13)中配置了推理模型(如 kimi-k2.5 通过 Moonshot API 或 OpencodeGO 提供商),启用了本地函数调用( function_calling: native )和至少一个工具(如网络搜索、代

用户在运行 Ollama 0.30.x (0.30.0 ~ 0.30.8) 时,调用多模态模型(如 Qwen3.5:4b)进行图片 OCR 或图片加载时发生。模型正常加载,但卡在“processing image... encoding image slice...”步骤,CPU 满负载,进程无响应
![[Bug]: table parser not use llm](https://www.chat-gpts.plus/wp-content/uploads/2026/06/11930-7e0e2bea-768x403.jpg)
用户在 RAGFlow v0.22.1 中,使用 "Table"(表格)解析方法创建知识库并上传 Excel 文件后,在对话中提问时,系统仅返回检索到的原始表格数据,没有通过 LLM 生成自然语言回答。
![[Question]: where config the AccessKeyId of Minio in ragflow](https://www.chat-gpts.plus/wp-content/uploads/2026/06/5938-65b1b296-768x403.jpg)
用户在 RAGFlow 中上传 Excel 文件( test.xlsx )并进行文档解析时,系统报错文件不存在,同时用户需要知道如何配置 MinIO 的 AccessKeyId。用户通过 Docker 部署 RAGFlow,后端使用了 MinIO 作为对象存储后端。

瑞典皇家理工学院教授 Martin Monperrus 在 arXiv 上提交了一篇引发争议的论文,认为基于大模型(LLM)的“编码代理”(coding agent)已具备足够能力,可以完全取代自 1976 年以来一直是软件工程基石的“人工代码审查”环节。作者认为,不仅人类审查这道工序成本高、效率低,而且“A…
![[Bug]: FP8 MoE models produce corrupted output when serving LoRA adapters](https://www.chat-gpts.plus/wp-content/uploads/2026/06/42007-9ef8b881-768x403.jpg)
用户在 vLLM 0.20.0 上,使用 FP8(E4M3)量化的 MoE 模型(如 Mixtral 8x7B 等),并同时加载 LoRA 适配器进行推理服务时触发。该问题同样可能影响其他基于 Triton 的 MoE+LoRA 推理流程。Issue 作者是在 vLLM 的 main 分支上(而非稳
![[Bug]: MoE base model requests may be affected by LoRA deltas when LoRA adapters are loaded](https://www.chat-gpts.plus/wp-content/uploads/2026/06/42008-b2a1e60a-768x403.jpg)
用户在 vLLM 服务中配置了 LoRA adapter,随后发送针对基座模型(不应用 LoRA)的推理请求。在 MoE 架构的基座模型上,部分请求的输出被错误地叠加了 LoRA 的 delta 权重,导致推理结果出现偏差。

用户在 Ubuntu 22.04 系统上,通过 Ollama 0.30.5 运行 ollama run gemma4:12b-it-q8_0 --verbose 时,出现 llama-server 内部 CUDA 错误。用户使用的显卡为 Tesla V100-SXM2-32GB(Compute Ca
![[llms.txt] seedaudio.co llms.txt](https://www.chat-gpts.plus/wp-content/uploads/2026/06/ai_cover_3-863-768x403.jpg)
音频素材平台 seedaudio.co 推出了 llms.txt 文件,这是一份专门面向大语言模型(LLM)的站点结构化摘要,旨在让 AI 应用更高效、准确地抓取和利用站内音频资源。这标志着版权音频素材与 AI 数据训练流程之间的一次标准化对接尝试。