Performance regression in Ollama v0.30 on 5x GTX 1070 Ti: much slower than v0.24, low GPU clocks/utilization

用户在 Debian Linux 系统上,使用 5 张 NVIDIA GTX 1070 Ti(每张 8 GB)的多 GPU 配置运行 Ollama。从 v0.24.0 升级到 v0.30 后,加载相同模型(gemma4:26b-a4b-it-q4_K_M)并执行相同 prompt 时,推理速度出现约

Performance regression in Ollama v0.30 on 5x GTX 1070 Ti: much slower than v0.24, low GPU clocks/utilization

Performance regression in Ollama v0.30 on 5x GTX 1070 Ti: much slower than v0.24, low GPU clocks/utilization

快速结论:此问题通常发生在 Ollama 升级到 v0.30 后,在 NVIDIA 多 GPU 环境下(特别是 GTX 1070 Ti 等 Pascal 架构显卡)出现性能严重下降。优先排查 NVIDIA 驱动版本,确保驱动满足 Ollama 新版本所需的 CUDA 运行时要求。

问题场景

用户在 Debian Linux 系统上,使用 5 张 NVIDIA GTX 1070 Ti(每张 8 GB)的多 GPU 配置运行 Ollama。从 v0.24.0 升级到 v0.30 后,加载相同模型(gemma4:26b-a4b-it-q4_K_M)并执行相同 prompt 时,推理速度出现约 5-6 倍的性能下降。

报错原文

time=2026-06-02T13:52:49.127+03:00 level=DEBUG source=model_recommendations.go:181 msg="stopping model recommendations cache"
time=2026-06-02T13:52:49.127+03:00 level=DEBUG source=sched.go:227 msg="shutting down scheduler pending loop"
time=2026-06-02T13:52:49.127+03:00 level=DEBUG source=sched.go:368 msg="shutting down scheduler completed loop"

输出性能日志:
n_decoded = 100, tg = 32.66 t/s
n_decoded = 280, tg = 18.42 t/s
n_decoded = 456, tg = 9.90 t/s
n_decoded = 722, tg = 6.83 t/s

关键错误日志:
msg="NVIDIA driver too old" device="NVIDIA GeForce GTX 1070 Ti" compute=6.1 driver=535 required_driver="570 or newer"
ggml_cuda_init: failed to initialize CUDA: CUDA driver version is insufficient for CUDA runtime version

原因分析

根本原因:安装的 NVIDIA 驱动版本过旧。用户使用的是驱动版本 535,不满足 Ollama v0.30 所依赖的 CUDA 运行时要求(需驱动版本 570 或更新)。

由于 CUDA 初始化失败,Ollama 自动降级并尝试其他后端(可能是 Vulkan),导致 GPU 不能以 CUDA 模式正常运行。虽然 GPU 仍被检测到,但实际的推理执行效率极低,表现为 GPU 时钟频率偏低(约 139 MHz / 405 MHz)、利用率不稳定、功耗低。

注意:以下情况也可能导致类似问题,属于可能原因:
– 部分 AMD/Intel 显卡用户可能需要设置环境变量 OLLAMA_IGPU_ENABLE=1(在 Issue 讨论中有社区用户反馈此方法对其 AMD Radeon 8060S 有效)。
– 其他可能的系统配置变更或多 GPU 调度逻辑退化。

环境排查

  • NVIDIA 驱动版本:确认当前安装的驱动版本(使用 nvidia-smi 查看 “Driver Version”)。
  • CUDA 版本:检查 nvidia-smi 中的 “CUDA Version” 是否与驱动兼容。
  • 操作系统的补丁与内核版本。
  • Ollama 版本号:确认是 v0.30(或其他导致问题的版本)还是 v0.24 等旧版。
  • 模型与参数:确认是否有手动设置 num_gpu 999 等强制 GPU 卸载参数。
  • GPU 架构:检查显卡是否为 Pascal 架构(如 GTX 1070 Ti)或其他需要特定 CUDA 支持的架构。

解决步骤

  1. 首先,使用以下命令检查当前 NVIDIA 驱动版本:
    nvidia-smi
  2. 查看 Ollama 日志(通常在系统日志或 Ollama 的输出中)是否包含以下信息:
    NVIDIA driver too old

    CUDA driver version is insufficient for CUDA runtime version
  3. 如果驱动版本低于 570,请升级 NVIDIA 驱动至 570.211.01 或更高版本(根据 Issue 中用户使用的版本)。可优先尝试此方案。
  4. 升级驱动后重启系统,确认驱动版本更新:
    • 预期输出类似:Driver Version: 570.211.01 以及 CUDA Version: 12.8
  5. 重新启动 Ollama 服务,再次运行相同的模型与任务。
  6. 如果驱动版本已满足要求但问题依旧(例如社区中已有用户虽然驱动在 580 系列,性能仍有 20-30% 损失),检查 Ollama 日志确认是否还有其他 CUDA 初始化失败或降级信息。

可选排查(针对 AMD/Intel 显卡或部分场景):
– 在启动 Ollama 服务器前尝试设置环境变量 OLLAMA_IGPU_ENABLE=1,强制启用 GPU 加速。

验证方法

nvidia-smi 确认驱动版本满足要求(≥570),然后使用相同 prompt 测试推理性能,观察以下指标是否恢复:
– GPU 利用率稳定在合理范围(如 25% 左右,而非低负载或长时间空闲)
– GPU 时钟频率达到正常值(如 1.9 GHz 附近)
– 推理速度(response token/s 和 prompt token/s)恢复到接近 v0.24 的水平。
– Ollama 日志中不再出现 NVIDIA driver too oldCUDA driver version is insufficient 等错误。

参考来源

ollama/ollama #16415

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 14951

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注