RuntimeError: Already borrowed

该报错出现在 vLLM 服务化部署 Qwen3.5-122B-A10B-FP8 等大型 MoE 模型时,当大量并发请求(尤其是包含 image_url 内容的多模态请求)通过 /v1/chat/completions 接口发送,导致 EngineCore 进程崩溃。同一并发量下纯文本请求可以稳定运行

该报错出现在 vLLM 服务化部署 Qwen3.5-122B-A10B-FP8 等大型 MoE 模型时,当大量并发请求(尤其是包含 image_url 内容的多模态请求)通过 /v1/chat/completions 接口发送,导致 EngineCore 进程崩溃。同一并发量下纯文本请求可以稳定运行

在 vLLM 主分支(commit 55d037e2e5cc56c38a1a4a77a15c347fee380c50 )环境下,使用 ROCm 平台(GPU: gfx942/MI300X)部署 DeepSeek-R1 模型,设置环境变量 VLLM_ROCM_USE_AITER=1 和 VLLM_US

用户在安装了 PyTorch 2.4.0 和最新版 `transformers` 后,尝试导入 `from transformers.distributed.sharding_utils import DtensorShardOperation` 时触发。该问题还会级联影响到所有间接导入 `shar

用户在 ComfyUI(版本 0.3.27,前端 1.14.6)中使用内置遮罩编辑器编辑图像遮罩时,编辑器界面显示垂直贯穿图像的线条,且对遮罩的修改无法被保存。操作环境为 Windows 便携版(NVIDIA GPU, Python 2.6.0+cu126)。

用户在 Langfuse Cloud(Python SDK)中创建了一个文件夹格式的 dataset(名称格式如 "root/children"),随后使用 self.langfuse.get_dataset(self.dataset_name) 获取该 dataset,结果返回 HTTP 404

用户在 Windows 11(或部分 Windows 10 版本)上运行基于 Gradio 5.6.0 及以上版本编写的 Python WebUI 应用时(例如 demo.launch() ),控制台无端打印 INFO: Could not find files for the given patt

用户按照 Gradio 官方教程创建自定义 Chatbot 组件,在 Windows 系统的 conda 环境( AIenv )中执行 gradio cc create EditableChatbot --template Chatbot 创建项目后,运行 gradio cc dev 启动开发服务器
![[Bug] Potential DoS via Unbounded zlib.decompress (Zip Bomb Vulnerability) in Document Parser](https://www.chat-gpts.plus/wp-content/uploads/2026/07/22101-643a5001-768x403.jpg)
用户在使用 LlamaIndex 的 HWP 文档解析器( llama-index-readers-hwp )读取 HWP 文件时触发问题。攻击者可以通过提供包含超高压缩比内容的恶意文档(Zip Bomb),在解析过程中导致服务端内存耗尽(OOM),造成拒绝服务(DoS)。该问题通过静态代码分析发现

用户使用 LlamaIndex 的 RedisKVStore (通过 RedisDocumentStore 配合 IngestionPipeline)时,在调用 pipeline.run() 或 docstore.get_all_document_hashes() 时触发。通常发生在 Redis 连
![[CI Failure]: LM Eval PCP (4xB200)](https://www.chat-gpts.plus/wp-content/uploads/2026/07/49334-644d5265-768x403.jpg)
该问题在 vLLM 项目的 CI 流水线中被触发,具体场景为运行 evals/gsm8k 中的 test_gsm8k_correctness 测试用例,测试环境配置为 4 块 B200 GPU。用户在执行 PCP (Precision Calibration Profile) 结合 MLA (Mul