Pass app_id to model plugins for provider-side cost attribution

用户在 Dify 平台中构建了自定义模型插件(例如为 Amazon Bedrock 的 Converse API 添加 requestMetadata 标签进行成本追踪),但在模型插件中只能获取 user_id ,而无法获取 app_id 。这导致无法将 LLM 调用与具体应用关联,从而无法实现按应

用户在 Dify 平台中构建了自定义模型插件(例如为 Amazon Bedrock 的 Converse API 添加 requestMetadata 标签进行成本追踪),但在模型插件中只能获取 user_id ,而无法获取 app_id 。这导致无法将 LLM 调用与具体应用关联,从而无法实现按应

该问题出现在 vLLM CI 的 fork 模式 EngineCore 测试中,具体涉及:

用户使用 vLLM 在 Intel XPU(Arc GPU)的 Docker 容器中运行 vllm serve 命令时出现此错误。复现环境:基于 Intel oneAPI / PyTorch 2.12.0+xpu 的 Docker 自定义镜像,Level Zero 驱动可正常检测到 2 张 GPU(

用户在 Open WebUI v0.10.2 中配置了 ComfyUI 图片生成引擎(Admin Panel → Settings → Images),验证连接成功,ComfyUI 自身工作正常且能直接生成图片。但在聊天界面点击消息操作栏的 Generate Image 动作时,后端报错且无图片产出

用户使用 Docker 安装的 Open WebUI 10.0.2 版本,运行在 Ubuntu 上。最初连接了 Ollama 提供商的 4 个模型并设置了某些用户的模型访问权限,之后切换到 llama.cpp 后端的模型,并删除了 Ollama 提供商。虽然 Ollama 模型已从模型列表中消失,但

用户在 Open WebUI 0.10.2 版本中,使用 Docker 部署,搭配 Ollama 0.31.1 运行模型(例如 Qwen3.5 4B),并设置了自定义标题生成提示词。在开始新聊天时,系统会同时发送两个并发请求:一个用于标题生成,另一个用于助理响应。标题生成请求在助理响应之前触发,导致

用户在 HuggingFace Transformers 库的 generate() 调用中,使用 cache_implementation="static" 静态缓存路径,并希望通过 cache_config={"max_cache_len": N} 控制缓存的最大长度。但实际观察发现, cach

用户在 Hugging Face Transformers 中使用 generate() 进行文本生成,启用了 torch.compile 和 chunked prefill(通过设置 generation_config.prefill_chunk_size ),并使用静态缓存(Static Cac

用户在 Arch Linux(Cachy OS)上使用 AMD 7800XT GPU 运行 ComfyUI,每次打开软件首次生成图像时都卡在加载 checkpoint 步骤,且重启后问题重复。用户已正确安装 PyTorch ROCm 版本,创建 venv 并安装 requirements.txt。
![[Bug]: [ERROR][Exception]: Exceptions from Trio nursery](https://www.chat-gpts.plus/wp-content/uploads/2026/07/12545-a5895cec-768x403.jpg)
用户使用 RAGFlow v0.22.1,上传包含 10,382 个文件的知识库进行大规模解析,并点击生成知识图谱(Knowledge Graph)。在嵌入节点处理到约 1809/1894 步时,服务返回 500 错误,解析任务中断且无法通过界面按钮继续。