Eval bug: SIGSEGV running DS4F on Intel B70 (Missing SYCL f16 Conversion)

此报错发生在 llama.cpp 使用 SYCL 后端(Intel Arc Pro B70)运行 DeepSeek-V4-Flash 模型时,首次推理即崩溃,根因是 set_rows 算子缺少 F16 半精度类型转换,导致 SYCL 设备指针被 CPU 后端当作主机地址解引用。优先排查你是否使用了包

此报错发生在 llama.cpp 使用 SYCL 后端(Intel Arc Pro B70)运行 DeepSeek-V4-Flash 模型时,首次推理即崩溃,根因是 set_rows 算子缺少 F16 半精度类型转换,导致 SYCL 设备指针被 CPU 后端当作主机地址解引用。优先排查你是否使用了包

该报错通常发生在使用 llama.cpp 的 RPC 功能,将 DeepSeek V4 等大模型的长提示词(超过 4096 tokens)分配到 AMD gfx1151(Radeon 8060S / Ryzen AI Max+ 395)ROCm 后端进行预填充时,远程 RPC 工作进程会直接崩溃。优

该报错通常发生在 NVIDIA GB10(sm_121 架构)设备上尝试启动 DeepSeek-V4 模型时,vLLM 检测到 DeepGEMM 可用但没有正确的架构判断,导致在编译内核中触发断言错误。优先排查是否通过环境变量或补丁正确限制了 DeepGEMM 在 sm_121 上的启用。
![[Bug]: vLLM hangs after NCCL init with TP=2 on Blackwell GPUs (CUDA 13.0, NCCL 2.27.7)](https://www.chat-gpts.plus/wp-content/uploads/2026/09/33041-30149f9a-768x403.jpg)
该报错是 vLLM 在使用张量并行(TP=2)初始化 NCCL 后卡死,常见于 Blackwell 架构 GPU(如 RTX PRO 6000、RTX 5090、B300)且未启用 NVLink、依赖 PCIe 通信的场景。优先排查 BIOS 中的 IOMMU / ACS 是否开启,并尝试禁用 P2

该报错发生在 Ollama 导入新架构模型的 GGUF 文件时,因为 Ollama 内置的 llama-quantize 尚未包含该架构的兼容补丁。优先排查你的模型架构是否在 Ollama 当前支持列表中,并考虑升级 Ollama 或等待官方支持。
![[Bug]: rerank_by_model drops question_tks, so a configured rerank model never sees chunk questions](https://www.chat-gpts.plus/wp-content/uploads/2026/08/18472-95f179cb-768x403.jpg)
该问题发生在 RAGFlow 配置了 rerank 模型且数据集中分块带有自动生成问题(question_kwd / question_tks)的场景。由于 rerank_by_model 路径在构建传给 cross-encoder 的文档字符串时遗漏了 question_tks ,导致模型重排时完

该报错发生在 RAGFlow 通过 Docker Compose 启动时,Infinity 冷启动重放元数据超过 120 秒导致主 API 服务初始化失败。优先排查方向是 docker/entrypoint.sh 中主 Web 服务循环未加 || true 保护,被 set -e 静默终止且不会自动

该报错发生在 llama-server 启用 unified KV cache 且并行处理多个请求时,第二个请求开始处理后,第一个请求的解码出现上下文错乱(表现为“失忆”和幻觉)。优先排查是否启用了 unified KV cache(`-ub` 参数),并确认是否使用了索引器(indexer)类模型

该报错是 llama.cpp 的 Vulkan 推理引擎在处理大量图像输入时出现内存泄漏,每次 Chat Completion 请求会额外增加约 300MB 显存/内存占用,直到系统内存耗尽被 Ubuntu OOM 杀掉。优先排查是否使用了 Vulkan 后端,以及是否调用的是 OpenAI 兼容接

一位长期主张在 Git 提交中把 Claude Code 列为共同作者的开发者,如今公开改变了立场,理由是这种做法会稀释开发者对代码质量的责任感。这个转变折射出 AI 辅助编程从“新鲜事物”走向“默认工具”后,行业对署名、责任和透明度的重新校准。