快速结论:Ollama Cloud 付费用户在使用云模型(如 deepseek-v4-pro:cloud)进行长耗时推理时,会在约 182 秒处被服务端强制断开连接。优先确认是否所有云模型请求均在相同时间点失败,因为这是服务端硬超时,客户端无法绕过。
适用环境:Ollama Cloud Pro/Max 订阅、任意云模型(glm-5.1:cloud、qwen3.5:cloud、deepseek-v4-pro:cloud 等)、OpenClaw 等 agent 工具,服务器端 Linux 环境。
最快修复方案:暂无确认的一步修复方案。Issue 中提到的唯一有效缓解手段是客户端实现基于 token 活跃度的超时管理(OpenClaw 曾尝试),但这并不能解除服务端 182 秒硬断开,只是让失败更可控。
注意事项:这是服务端行为,修改本地 Ollama 配置、重装系统、更换客户端均无效;不要误认为是本地网络或代理问题。
问题场景
用户使用 Ollama Cloud API 调用云端模型,例如通过 curl 请求 /api/chat 接口,或通过 OpenClaw 等 agent 工具进行多步骤推理、工具链调用。当模型仍在正常生成 token、但单次请求总时长超过约 182 秒时,连接被服务端强制断开。即使模型输出尚未完成、订阅为 Pro/Max 档位,也无法幸免。
报错原文
Cloud API: 182-second hard timeout kills agent workflows — no way to extend
[agent/embedded] embedded run agent end: isError=true model=deepseek-v4-pro:cloud error=LLM request timed out. rawError=This operation was aborted
[model-fallback/decision] decision=candidate_failed reason=timeout next=none detail=LLM request timed out.
原因分析
这是 Ollama Cloud 服务端的硬编码超时,约 182 秒(182,000 ms,实测误差 ±50ms)。从 Issue 证据看,三次不同时间的失败都在 182,043ms / 182,043ms / 181,997ms 结束,时间高度一致,说明这不是网络波动或客户端导致的超时,而是服务端主动切断连接。即使模型仍在生成,服务端也会在固定时间点杀请求。并且日志中 next=none 表示所有回退模型都命中了同一超时,导致 agent 没有任何后备路径。
可能原因:服务端为控制资源消耗,对单个请求设置了硬性时间上限,且未在文档中公开该限制,也未提供任何可配置选项。
环境排查
- 确认订阅档位:Pro 或 Max(Issue 中确认 Pro 受影响,Max 未验证)。
- 确认本地 Ollama 版本为最新版,但仍无法规避服务端限制。
- 确认使用的是云模型(如
deepseek-v4-pro:cloud),本地模型不受影响。 - 检查所有云模型是否都在 182 秒附近失败,排除单一模型配置问题。
解决步骤
- 先确认是否所有云模型请求都在约 182 秒处失败。用
curl -s --max-time 300发起一个长 prompt,观察结束时间是否精确落在 182,xxx ms。 - 可优先尝试在客户端对单次请求拆分:把超长任务拆成多个短请求,通过上下文传递中间结果,避免单次调用超过 180 秒。
- 可优先尝试使用流式模式(
"stream":true)与大模型建立 WebSocket 长连接,观察是否同样被断开。 - 可优先尝试接入本地模型或第三方云模型作为 fallback,避免将 agent 整个回合押在单一 Ollama Cloud 请求上。
- 关注 Ollama Cloud 官方文档或 Issue 更新,等待服务端开放超时配置或提高上限(Issue 请求将超时提升至 600 秒或开放配置项)。
验证方法
发起一个预计耗时超过 200 秒的长请求,记录结束时间。若在约 182 秒处被断开,说明该问题依旧存在,与本地环境无关。若请求能超过 182 秒并正常返回,说明服务端已调整或该模型未命中硬超时。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。
![[Bug][ROCm]: AITER FP8 BMM segfaults with data parallel attention](https://www.chat-gpts.plus/wp-content/uploads/2026/09/51957-868e46e8-768x403.jpg)
