Misc. bug: It’s taking a long time for the download or model to load.

用户在 Linux 系统上运行 llama.cpp( llama-cli 或 llama-server ),使用 -hf ggml-org/gemma-3-1b-it-GGUF:Q4_K_M 等命令下载或加载模型时触发。问题重现于 Vulkan、ROCm 和 CPU 后端,涉及 AMD Radeon

用户在 Linux 系统上运行 llama.cpp( llama-cli 或 llama-server ),使用 -hf ggml-org/gemma-3-1b-it-GGUF:Q4_K_M 等命令下载或加载模型时触发。问题重现于 Vulkan、ROCm 和 CPU 后端,涉及 AMD Radeon

用户在使用 llama-bench 工具测试 Qwen3-8B-Q4_K_M.gguf 模型时触发问题,硬件为 MINISFORUM MS-R1(CIX CP8180 SoC),配备 Mali-G720-Immortalis GPU 和共享内存池(UMA)。即使用 -ngl 0 参数禁止层卸载到 G

用户在 Dify 平台中构建了自定义模型插件(例如为 Amazon Bedrock 的 Converse API 添加 requestMetadata 标签进行成本追踪),但在模型插件中只能获取 user_id ,而无法获取 app_id 。这导致无法将 LLM 调用与具体应用关联,从而无法实现按应

该问题出现在 vLLM CI 的 fork 模式 EngineCore 测试中,具体涉及:

用户使用 vLLM 在 Intel XPU(Arc GPU)的 Docker 容器中运行 vllm serve 命令时出现此错误。复现环境:基于 Intel oneAPI / PyTorch 2.12.0+xpu 的 Docker 自定义镜像,Level Zero 驱动可正常检测到 2 张 GPU(

用户在 Open WebUI v0.10.2 中配置了 ComfyUI 图片生成引擎(Admin Panel → Settings → Images),验证连接成功,ComfyUI 自身工作正常且能直接生成图片。但在聊天界面点击消息操作栏的 Generate Image 动作时,后端报错且无图片产出

用户使用 Docker 安装的 Open WebUI 10.0.2 版本,运行在 Ubuntu 上。最初连接了 Ollama 提供商的 4 个模型并设置了某些用户的模型访问权限,之后切换到 llama.cpp 后端的模型,并删除了 Ollama 提供商。虽然 Ollama 模型已从模型列表中消失,但

用户在 Open WebUI 0.10.2 版本中,使用 Docker 部署,搭配 Ollama 0.31.1 运行模型(例如 Qwen3.5 4B),并设置了自定义标题生成提示词。在开始新聊天时,系统会同时发送两个并发请求:一个用于标题生成,另一个用于助理响应。标题生成请求在助理响应之前触发,导致

用户在 HuggingFace Transformers 库的 generate() 调用中,使用 cache_implementation="static" 静态缓存路径,并希望通过 cache_config={"max_cache_len": N} 控制缓存的最大长度。但实际观察发现, cach

用户在 Hugging Face Transformers 中使用 generate() 进行文本生成,启用了 torch.compile 和 chunked prefill(通过设置 generation_config.prefill_chunk_size ),并使用静态缓存(Static Cac