Cloud API: 182-second hard timeout kills agent workflows — no way to extend

Ollama Cloud 付费用户在使用云模型(如 deepseek-v4-pro:cloud)进行长耗时推理时,会在约 182 秒处被服务端强制断开连接。优先确认是否所有云模型请求均在相同时间点失败,因为这是服务端硬超时,客户端无法绕过。

快速结论:Ollama Cloud 付费用户在使用云模型(如 deepseek-v4-pro:cloud)进行长耗时推理时,会在约 182 秒处被服务端强制断开连接。优先确认是否所有云模型请求均在相同时间点失败,因为这是服务端硬超时,客户端无法绕过。

适用环境:Ollama Cloud Pro/Max 订阅、任意云模型(glm-5.1:cloud、qwen3.5:cloud、deepseek-v4-pro:cloud 等)、OpenClaw 等 agent 工具,服务器端 Linux 环境。

最快修复方案:暂无确认的一步修复方案。Issue 中提到的唯一有效缓解手段是客户端实现基于 token 活跃度的超时管理(OpenClaw 曾尝试),但这并不能解除服务端 182 秒硬断开,只是让失败更可控。

注意事项:这是服务端行为,修改本地 Ollama 配置、重装系统、更换客户端均无效;不要误认为是本地网络或代理问题。

问题场景

用户使用 Ollama Cloud API 调用云端模型,例如通过 curl 请求 /api/chat 接口,或通过 OpenClaw 等 agent 工具进行多步骤推理、工具链调用。当模型仍在正常生成 token、但单次请求总时长超过约 182 秒时,连接被服务端强制断开。即使模型输出尚未完成、订阅为 Pro/Max 档位,也无法幸免。

报错原文

Cloud API: 182-second hard timeout kills agent workflows — no way to extend
[agent/embedded] embedded run agent end: isError=true model=deepseek-v4-pro:cloud error=LLM request timed out. rawError=This operation was aborted
[model-fallback/decision] decision=candidate_failed reason=timeout next=none detail=LLM request timed out.

原因分析

这是 Ollama Cloud 服务端的硬编码超时,约 182 秒(182,000 ms,实测误差 ±50ms)。从 Issue 证据看,三次不同时间的失败都在 182,043ms / 182,043ms / 181,997ms 结束,时间高度一致,说明这不是网络波动或客户端导致的超时,而是服务端主动切断连接。即使模型仍在生成,服务端也会在固定时间点杀请求。并且日志中 next=none 表示所有回退模型都命中了同一超时,导致 agent 没有任何后备路径。

可能原因:服务端为控制资源消耗,对单个请求设置了硬性时间上限,且未在文档中公开该限制,也未提供任何可配置选项。

环境排查

  • 确认订阅档位:Pro 或 Max(Issue 中确认 Pro 受影响,Max 未验证)。
  • 确认本地 Ollama 版本为最新版,但仍无法规避服务端限制。
  • 确认使用的是云模型(如 deepseek-v4-pro:cloud),本地模型不受影响。
  • 检查所有云模型是否都在 182 秒附近失败,排除单一模型配置问题。

解决步骤

  1. 先确认是否所有云模型请求都在约 182 秒处失败。用 curl -s --max-time 300 发起一个长 prompt,观察结束时间是否精确落在 182,xxx ms。
  2. 可优先尝试在客户端对单次请求拆分:把超长任务拆成多个短请求,通过上下文传递中间结果,避免单次调用超过 180 秒。
  3. 可优先尝试使用流式模式("stream":true)与大模型建立 WebSocket 长连接,观察是否同样被断开。
  4. 可优先尝试接入本地模型或第三方云模型作为 fallback,避免将 agent 整个回合押在单一 Ollama Cloud 请求上。
  5. 关注 Ollama Cloud 官方文档或 Issue 更新,等待服务端开放超时配置或提高上限(Issue 请求将超时提升至 600 秒或开放配置项)。

验证方法

发起一个预计耗时超过 200 秒的长请求,记录结束时间。若在约 182 秒处被断开,说明该问题依旧存在,与本地环境无关。若请求能超过 182 秒并正常返回,说明服务端已调整或该模型未命中硬超时。

参考来源

ollama/ollama #15973

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 21266

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注