vram usage does not go back down after model unloads – stuck in Stopping…

该报错通常出现在 Ollama 模型卸载后 VRAM 无法回降、状态卡在 Stopping... 的场景。优先排查 ollama_llama_server 子进程是否残留,以及客户端(如 n8n)是否过早断开连接。

快速结论:该报错通常出现在 Ollama 模型卸载后 VRAM 无法回降、状态卡在 Stopping... 的场景。优先排查 ollama_llama_server 子进程是否残留,以及客户端(如 n8n)是否过早断开连接。

适用环境:Windows 11、AMD RX 7800 XT / 24.8.1 驱动(用户原驱动为 24.9.x)、ROCm 6.1、Ollama 0.4.1(Issue 讨论环境中使用的版本)。

最快修复方案:暂无确认的一步官方修复方案。可优先尝试:

  • 检查并手动终止残留的 ollama_llama_server 进程(在资源管理器中结束任务或使用 taskkill /IM ollama_llama_server.exe /F)。
  • 将 AMD 显卡驱动降级至 24.8.1(关联 Issue #7107 中提到的潜在修复,尚未在此 Issue 中完全确认)。
  • 在 n8n 等客户端中,可临时使用“强制杀死 ollama 进程”的工作流(用户已验证,但非推荐方案)。

注意事项:降级驱动可能影响其他软件的稳定性,请评估风险后操作;强制杀死进程可能导致未保存的上下文丢失。

问题场景

用户在 Windows 平台使用 Ollama 运行 llama3.2:3b 模型,通过 n8n 或 Discord bot 调用 Ollama API,设置 keep alive=0 期望模型立即卸载,但 ollama ps 显示模型状态卡在 Stopping...,VRAM 使用没有回降到加载模型前的水平,ollama_llama_server 子进程持续占用显存。手动退出整个 Ollama 程序后 VRAM 才恢复正常。

报错原文

vram usage does not go back down after model unloads - stuck in Stopping...

ollama ps 输出中模型状态显示为 Stopping...,且长时间不消失。

原因分析

根据 Issue 讨论,可能原因包括:

  • 调度器竞争条件:在多并发调用或客户端连接过早关闭时,Ollama 调度器可能出现竞态,导致模型卸载信号未正确传递到 ollama_llama_server,子进程未能正常退出。
  • 客户端连接处理异常:使用 n8n、Discord bot 等非标准客户端时,如果连接意外关闭而未发送正常的卸载请求,模型可能停留在 Stopping... 状态。
  • AMD 驱动版本问题:用户使用的驱动版本(24.9.x)可能与其他已知问题相关(如 #7107),导致 VRAM 释放异常。
  • Ollama 0.4.1 的 bug:该版本可能存在未完全处理的卸载流程,在后续版本(如 0.6.5)中社区观察到类似现象已被部分修复,但未完全解决。

环境排查

celebrityanime
celebrityanime
文章: 15302

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注