some pascal gpus not supported anymore?

该报错通常出现在 Ollama 0.32.11 至 0.32.13 版本中,当系统检测到 Pascal 架构(如 Quadro P6000/P4000)时,因编译架构列表中不再包含对应计算能力(cc=610)而直接跳过 GPU。优先排查当前 Ollama 安装包是否仍保留旧版 CUDA 库(如 cu

快速结论:该报错通常出现在 Ollama 0.32.11 至 0.32.13 版本中,当系统检测到 Pascal 架构(如 Quadro P6000/P4000)时,因编译架构列表中不再包含对应计算能力(cc=610)而直接跳过 GPU。优先排查当前 Ollama 安装包是否仍保留旧版 CUDA 库(如 cuda_v11),或回退到 0.32.10 及更早版本。

适用环境:Ollama 0.32.13,Linux(systemd 服务),NVIDIA 驱动 580.173.02,CUDA 13.0(驱动报告),Quadro P6000/P4000(Pascal 架构,计算能力 6.1),Vulkan 启用(OLLAMA_VULKAN=true),Intel HD Graphics 510 作为集成 GPU。

最快修复方案:暂无确认的一步修复方案。Issue 中用户提出降级驱动或回退 Ollama 版本作为尝试方向,但尚未在讨论中得到官方验证。可优先尝试回退 Ollama 到 0.32.10 或更早版本,并检查是否仍调用旧版 CUDA 库。

注意事项:Ollama 日志显示其 CUDA 库目录为 cuda_v13,编译架构列表从 750 到 1210,未包含 Pascal 的 610。这可能是 0.32.11 起默认编译行为变化所致,也可能是驱动识别异常。回退版本可能带来其他功能缺失,降级驱动也可能影响 CUDA 13 相关应用,操作前请备份数据。

问题场景

用户在多 GPU 机器上运行 Ollama 0.32.13,系统识别到 5 张 NVIDIA 显卡(3 张 Quadro P6000、2 张 Quadro P4000),但 Ollama 日志显示所有 Pascal 设备因“compute capability not in compiled architectures”被跳过,GPU 无法用于推理。此前 0.32.11 以下版本可正常工作。

报错原文

level=INFO source=llama_server.go:299 msg="skipping CUDA device — compute capability not in compiled architectures" device="Quadro P6000" cc=610 archs="[750 800 860 870 890 900 1000 1030 1100 1200 1210]" libDirs="[/usr/local/lib/ollama /usr/local/lib/ollama/cuda_v13]"

原因分析

Ollama 0.32.11 起可能调整了 CUDA 编译架构默认列表,不再包含 Pascal 系列(计算能力 6.1)。日志中 archs 显示的最低架构为 750(对应 Turing),导致旧卡被主动跳过。这可能原因:

  • Ollama 在新版本中默认仅编译新版 CUDA 库(cuda_v13),而该库未包含 Pascal 架构。
  • NVIDIA 驱动 580 报告 CUDA 13.0,但 Pascal 卡在驱动层仍走旧路径,Ollama 检测逻辑未能兼容。
  • 用户配置了 OLLAMA_VULKAN=true,Vulkan 路径可能干扰 CUDA 设备发现,尽管日志中 Vulkan 只用于集成 GPU。

环境排查

  • 确认 Ollama 版本:ollama --version,若 ≥0.32.11 则重点排查。
  • 查看实际 CUDA 库目录:ls /usr/local/lib/ollama/,确认是否只有 cuda_v13
  • 检查驱动与 CUDA 匹配:nvidia-smi 顶部确认驱动版本和 CUDA 版本。
  • 确认显卡计算能力:nvidia-smi --query-gpu=name,compute_cap --format=csv,P6000/P4000 应为 6.1。
  • 启用调试日志:OLLAMA_DEBUG=2(或 =INFO),观察 journalctl -u ollama 中完整设备发现过程。

解决步骤

  1. 备份现有模型和配置:确保 OLLAMA_MODELS 目录(如 /usr/share/ollama/.ollama/models)有备份。
  2. 回退 Ollama 版本(可优先尝试):卸载当前 0.32.13,安装 0.32.10 或更早版本,启动后检查日志是否仍跳过 Pascal 设备。
  3. 尝试降级 NVIDIA 驱动:如 Issue 所述,580 驱动可能使 Ollama 误判 CUDA 版本。建议安装 550 或 535 系列驱动,重启后重新测试。
  4. 清理或重装 Ollama CUDA 库:若旧版本恢复正常,可对比新旧安装包中 cuda_v* 目录差异;需要时手动复制旧版 cuda_v11 目录(若存在)到新版本目录。
  5. 关闭 Vulkan 选项:临时设置 OLLAMA_VULKAN=false(在服务文件中修改 Environment),排除 Vulkan 干扰。

验证方法

修改后重启 Ollama 服务(systemctl restart ollama),在 journalctl -u ollama -f 中观察日志。若不再出现 skipping CUDA device 且出现 inference compute 或类似表示 GPU 加载成功的消息,再执行 ollama run 模型名 测试推理速度;也可用 nvidia-smi 观察 llama-server 进程是否正确占用 GPU 显存。

参考来源

ollama/ollama #17766

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 18735

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注