Misc. bug: .`llama-server` starts on wrong port

用户在 Linux aarch64 系统上运行 llama-server (版本 9439, built with GNU 16.1.1)时,未指定 --port 参数,预期默认端口为 8080,但访问 http://127.0.0.1:8080/app 返回 404 错误。用户推测 llama-s

用户在 Linux aarch64 系统上运行 llama-server (版本 9439, built with GNU 16.1.1)时,未指定 --port 参数,预期默认端口为 8080,但访问 http://127.0.0.1:8080/app 返回 404 错误。用户推测 llama-s
![[Bug]: Prefix-read and no-prefix-read paths can yield different greedy answers for the same prompt](https://www.chat-gpts.plus/wp-content/uploads/2026/06/42699-ab6cf9ef-768x403.jpg)
用户在 vLLM 推理服务中启用 prefix caching 功能(V1 引擎),使用 Qwen2-0.5B 模型(bf16 精度,TP=1),在 NVIDIA RTX 4090 或 3090 上运行时,同一 prompt 因是否命中前缀缓存而产生不同的语义输出(例如:缓存路径输出 "her ri
![[Bug]: GLM-5(Sparse MLA / DSA 模型)无法在 sm80 GPU(A100/A800)上运行 — DeepGemm 硬依赖无 fallback](https://www.chat-gpts.plus/wp-content/uploads/2026/06/35021-5544c92b-768x403.jpg)
用户在运行 vLLM (latest main, commit 1391378) 加载 ZhipuAI/GLM-5-FP8 模型时触发。环境为 8x NVIDIA A800-SXM4-80GB (sm80, Ampere),PyTorch 2.7.0+cu126,CUDA 12.6。用户通过 vll

资深工程师 Kent Beck(敏捷开发创始人之一)在 2026 年 5 月发表了一篇给新人的内部风格文章,核心观点是:公司雇佣新人不是为了“完成当前任务”,而是为了“投资未来的工程师”。他给出了区分优秀员工(A类)、合格员工(B类)和将被淘汰员工(C类)的具体信号,本质是对新人职场行为和成长逻辑的重新定义。

用户运行 ollama run zephyr ,第一次 prompt 正常,第二次 prompt 后报错。日志显示 CUDA 出现 out of memory 错误。

技术专家Lorin Hochstein在2026年6月19日发表文章,警告完全由大模型(LLM)撰写事故报告的趋势将带来严重隐患:表面合规但内心空洞的报告,会绕过人类思考过程,导致对系统故障的深层理解被替代,进而削弱整个学习与改进机制。

开发者 Sven Sauleau 发布了一款名为 Airgap 的 Linux 命令行工具,通过在 FUSE 文件系统中拦截并遮蔽敏感机密信息,阻止 AI 代理和 npm 安装过程中的恶意代码窃取 .env、SSH 密钥或云凭证,为当前 AI 代理横行与 npm 供应链攻击频发的环境提供了一种“看得见但拿不走…
![[Bug]: Why are the parsed images obscured when I use MinerU as a parser?](https://www.chat-gpts.plus/wp-content/uploads/2026/06/14197-842a7588-768x403.jpg)
在 RAGFlow 0.24.0 版本中使用 MinerU 解析器(Parser)处理 PDF 文档时,解析后输出的图像被部分遮挡/变暗,出现半透明黑色蒙层。该现象也存在于 pdf_parser、docling_parser、paddleocr_parser 等其他解析器中。
![[Bug]: from_openai_message misses vLLM-served Qwen3 reasoning field (uses 'reasoning' instead of 'reasoning_content')](https://www.chat-gpts.plus/wp-content/uploads/2026/06/21582-8f2b1a6d-768x403.jpg)
用户使用 LlamaIndex 的 OpenAI 兼容 LLM 客户端( llama-index-llms-openai )连接 vLLM 服务器(>=0.20.x),服务模型为 Qwen3/Qwen3.5/Qwen3.6 系列(如 Qwen/Qwen3.6-35B-A3B,并启用 --reason
![[Bug]: GLM-5 tool calls in stream mode get error tool name](https://www.chat-gpts.plus/wp-content/uploads/2026/06/39757-790e149e-768x403.jpg)
用户在使用 vLLM 部署 GLM-5 或 GLM-5.1 模型(如 zai-org/GLM-5.1-FP8 ),开启 stream=True 进行工具调用(tool call)时,流式返回的 tool_calls[].function.name 出现错误或截断,导致下游工具调用逻辑失败。该问题在代