[Bug]: Vllm + Gemma 4 + claude code: tool calling problems
![[Bug]: Vllm + Gemma 4 + claude code: tool calling problems](https://www.chat-gpts.plus/wp-content/uploads/2026/07/39043-5bb1c48d-768x403.jpg)
用户使用 vLLM 部署 Gemma 4 系列模型,通过 OpenAI 兼容 API 提供给 Claude Code 等工具进行多轮 agentic 工作流。在持续 20–30 次工具调用后,出现以下两类失败模式:
![[Bug]: Vllm + Gemma 4 + claude code: tool calling problems](https://www.chat-gpts.plus/wp-content/uploads/2026/07/39043-5bb1c48d-768x403.jpg)
用户使用 vLLM 部署 Gemma 4 系列模型,通过 OpenAI 兼容 API 提供给 Claude Code 等工具进行多轮 agentic 工作流。在持续 20–30 次工具调用后,出现以下两类失败模式:

用户在 Open WebUI v0.10.2 中,使用 vLLM 0.24.0 部署 Qwen3.5-122B-A10B-AWQ 模型(通过 OpenAI 兼容端点)。其他客户端(Jan.ai)连接同一个 vLLM 端点时输出正常。问题出现在 Open WebUI 内的对话中:表现为无输出、开始正常

用户通过 Docker 运行 Open WebUI(0.10.1/0.10.2)和 SearXNG 最新容器,配置了正确的 WebUI websearch 设置( http://searxng:8080/search?q=&format=json ),在 WebUI 中发起如 "Wha

用户在 Open WebUI v0.9.5/v0.9.6 中配置了 SearXNG 作为 Web 搜索引擎,发送聊天查询后联网搜索失败。该问题在 v0.9.4 中正常工作。用户环境包括 Docker 部署的 Open WebUI、llama.cpp 服务器以及 authentik OIDC 认证。

用户使用命令行 ollama run glm4:9b-chat-1m-q8_0 或 ollama run glm4 下载并运行 GLM-4-9B-Chat-1M 模型时,模型下载成功但加载失败,进程终止。问题出现在 macOS 系统上(Apple Silicon),Ollama 版本为 0.2.0

用户在使用 NVIDIA Jetson 设备(如 Orin AGX、Orin Nano、Thor)并安装了 JetPack 7.2 后,通过官方安装脚本 curl -fsSL https://ollama.com/install.sh | sh 安装 Ollama,安装过程中出现 unsupport

用户在执行 ollama pull 命令下载大模型(如 llama2 或任意模型)时,下载速度持续低下(约 10 Mbps),甚至偶尔降为零,需要重新下载。用户网络测速正常(约 100 Mbps),Steam 和 Epic Games 也能跑满带宽,但 ollama pull 和 Brave 浏览器

一位长期批评 Gemini 产品体验的开发者 Nikunj Kothari 坦言,尽管对用户体验有诸多不满,Gemini 仍是当前唯一能通过单一 API 密钥覆盖文本生成、图像生成、实时音频/视频、联网搜索等全栈能力的平台,这推动了大量“自带密钥”(BYOK)的 Side Project 生态。

知名 iOS 开发者 Peter Steinberger 在 X 上指出,AI 编程工具(如 Codex)在生成 UI 设计方面的表现常常不理想,但如果结合图像生成能力,让 AI 先“重新想象”一个设计再直接实现,效果可能完全不同——这条观察正在引发开发者社区对“图像生成 + 代码生成”组合使用场景的讨论。

Peter Yang 通过其 X 账号的简短推文,推广其面向 AI 和产品领域的付费订阅通讯,目前订阅者已超过 11 万。这反映出在 AI 工具快速迭代的当下,通过深度内容聚合与解读来服务开发者和创作者群体,正成为个人 IP 商业化的主流路径之一。