
Performance regression in Ollama v0.30 on 5x GTX 1070 Ti: much slower than v0.24, low GPU clocks/utilization
快速结论:此问题通常发生在 Ollama 升级到 v0.30 后,在 NVIDIA 多 GPU 环境下(特别是 GTX 1070 Ti 等 Pascal 架构显卡)出现性能严重下降。优先排查 NVIDIA 驱动版本,确保驱动满足 Ollama 新版本所需的 CUDA 运行时要求。
问题场景
用户在 Debian Linux 系统上,使用 5 张 NVIDIA GTX 1070 Ti(每张 8 GB)的多 GPU 配置运行 Ollama。从 v0.24.0 升级到 v0.30 后,加载相同模型(gemma4:26b-a4b-it-q4_K_M)并执行相同 prompt 时,推理速度出现约 5-6 倍的性能下降。
报错原文
time=2026-06-02T13:52:49.127+03:00 level=DEBUG source=model_recommendations.go:181 msg="stopping model recommendations cache"
time=2026-06-02T13:52:49.127+03:00 level=DEBUG source=sched.go:227 msg="shutting down scheduler pending loop"
time=2026-06-02T13:52:49.127+03:00 level=DEBUG source=sched.go:368 msg="shutting down scheduler completed loop"
输出性能日志:
n_decoded = 100, tg = 32.66 t/s
n_decoded = 280, tg = 18.42 t/s
n_decoded = 456, tg = 9.90 t/s
n_decoded = 722, tg = 6.83 t/s
关键错误日志:
msg="NVIDIA driver too old" device="NVIDIA GeForce GTX 1070 Ti" compute=6.1 driver=535 required_driver="570 or newer"
ggml_cuda_init: failed to initialize CUDA: CUDA driver version is insufficient for CUDA runtime version
原因分析
根本原因:安装的 NVIDIA 驱动版本过旧。用户使用的是驱动版本 535,不满足 Ollama v0.30 所依赖的 CUDA 运行时要求(需驱动版本 570 或更新)。
由于 CUDA 初始化失败,Ollama 自动降级并尝试其他后端(可能是 Vulkan),导致 GPU 不能以 CUDA 模式正常运行。虽然 GPU 仍被检测到,但实际的推理执行效率极低,表现为 GPU 时钟频率偏低(约 139 MHz / 405 MHz)、利用率不稳定、功耗低。
注意:以下情况也可能导致类似问题,属于可能原因:
– 部分 AMD/Intel 显卡用户可能需要设置环境变量 OLLAMA_IGPU_ENABLE=1(在 Issue 讨论中有社区用户反馈此方法对其 AMD Radeon 8060S 有效)。
– 其他可能的系统配置变更或多 GPU 调度逻辑退化。
环境排查
- NVIDIA 驱动版本:确认当前安装的驱动版本(使用
nvidia-smi查看 “Driver Version”)。 - CUDA 版本:检查
nvidia-smi中的 “CUDA Version” 是否与驱动兼容。 - 操作系统的补丁与内核版本。
- Ollama 版本号:确认是 v0.30(或其他导致问题的版本)还是 v0.24 等旧版。
- 模型与参数:确认是否有手动设置
num_gpu 999等强制 GPU 卸载参数。 - GPU 架构:检查显卡是否为 Pascal 架构(如 GTX 1070 Ti)或其他需要特定 CUDA 支持的架构。
解决步骤
- 首先,使用以下命令检查当前 NVIDIA 驱动版本:
nvidia-smi - 查看 Ollama 日志(通常在系统日志或 Ollama 的输出中)是否包含以下信息:
NVIDIA driver too old或
CUDA driver version is insufficient for CUDA runtime version - 如果驱动版本低于
570,请升级 NVIDIA 驱动至570.211.01或更高版本(根据 Issue 中用户使用的版本)。可优先尝试此方案。 - 升级驱动后重启系统,确认驱动版本更新:
- 预期输出类似:
Driver Version: 570.211.01以及CUDA Version: 12.8
- 预期输出类似:
- 重新启动 Ollama 服务,再次运行相同的模型与任务。
- 如果驱动版本已满足要求但问题依旧(例如社区中已有用户虽然驱动在
580系列,性能仍有 20-30% 损失),检查 Ollama 日志确认是否还有其他 CUDA 初始化失败或降级信息。
可选排查(针对 AMD/Intel 显卡或部分场景):
– 在启动 Ollama 服务器前尝试设置环境变量 OLLAMA_IGPU_ENABLE=1,强制启用 GPU 加速。
验证方法
用 nvidia-smi 确认驱动版本满足要求(≥570),然后使用相同 prompt 测试推理性能,观察以下指标是否恢复:
– GPU 利用率稳定在合理范围(如 25% 左右,而非低负载或长时间空闲)
– GPU 时钟频率达到正常值(如 1.9 GHz 附近)
– 推理速度(response token/s 和 prompt token/s)恢复到接近 v0.24 的水平。
– Ollama 日志中不再出现 NVIDIA driver too old 或 CUDA driver version is insufficient 等错误。



