快速结论:该报错通常出现在 Ollama 0.32.11 至 0.32.13 版本中,当系统检测到 Pascal 架构(如 Quadro P6000/P4000)时,因编译架构列表中不再包含对应计算能力(cc=610)而直接跳过 GPU。优先排查当前 Ollama 安装包是否仍保留旧版 CUDA 库(如 cuda_v11),或回退到 0.32.10 及更早版本。
适用环境:Ollama 0.32.13,Linux(systemd 服务),NVIDIA 驱动 580.173.02,CUDA 13.0(驱动报告),Quadro P6000/P4000(Pascal 架构,计算能力 6.1),Vulkan 启用(OLLAMA_VULKAN=true),Intel HD Graphics 510 作为集成 GPU。
最快修复方案:暂无确认的一步修复方案。Issue 中用户提出降级驱动或回退 Ollama 版本作为尝试方向,但尚未在讨论中得到官方验证。可优先尝试回退 Ollama 到 0.32.10 或更早版本,并检查是否仍调用旧版 CUDA 库。
注意事项:Ollama 日志显示其 CUDA 库目录为 cuda_v13,编译架构列表从 750 到 1210,未包含 Pascal 的 610。这可能是 0.32.11 起默认编译行为变化所致,也可能是驱动识别异常。回退版本可能带来其他功能缺失,降级驱动也可能影响 CUDA 13 相关应用,操作前请备份数据。
问题场景
用户在多 GPU 机器上运行 Ollama 0.32.13,系统识别到 5 张 NVIDIA 显卡(3 张 Quadro P6000、2 张 Quadro P4000),但 Ollama 日志显示所有 Pascal 设备因“compute capability not in compiled architectures”被跳过,GPU 无法用于推理。此前 0.32.11 以下版本可正常工作。
报错原文
level=INFO source=llama_server.go:299 msg="skipping CUDA device — compute capability not in compiled architectures" device="Quadro P6000" cc=610 archs="[750 800 860 870 890 900 1000 1030 1100 1200 1210]" libDirs="[/usr/local/lib/ollama /usr/local/lib/ollama/cuda_v13]"
原因分析
Ollama 0.32.11 起可能调整了 CUDA 编译架构默认列表,不再包含 Pascal 系列(计算能力 6.1)。日志中 archs 显示的最低架构为 750(对应 Turing),导致旧卡被主动跳过。这可能原因:
- Ollama 在新版本中默认仅编译新版 CUDA 库(cuda_v13),而该库未包含 Pascal 架构。
- NVIDIA 驱动 580 报告 CUDA 13.0,但 Pascal 卡在驱动层仍走旧路径,Ollama 检测逻辑未能兼容。
- 用户配置了
OLLAMA_VULKAN=true,Vulkan 路径可能干扰 CUDA 设备发现,尽管日志中 Vulkan 只用于集成 GPU。
环境排查
- 确认 Ollama 版本:
ollama --version,若 ≥0.32.11 则重点排查。 - 查看实际 CUDA 库目录:
ls /usr/local/lib/ollama/,确认是否只有cuda_v13。 - 检查驱动与 CUDA 匹配:
nvidia-smi顶部确认驱动版本和 CUDA 版本。 - 确认显卡计算能力:
nvidia-smi --query-gpu=name,compute_cap --format=csv,P6000/P4000 应为 6.1。 - 启用调试日志:
OLLAMA_DEBUG=2(或=INFO),观察journalctl -u ollama中完整设备发现过程。
解决步骤
- 备份现有模型和配置:确保
OLLAMA_MODELS目录(如/usr/share/ollama/.ollama/models)有备份。 - 回退 Ollama 版本(可优先尝试):卸载当前 0.32.13,安装 0.32.10 或更早版本,启动后检查日志是否仍跳过 Pascal 设备。
- 尝试降级 NVIDIA 驱动:如 Issue 所述,580 驱动可能使 Ollama 误判 CUDA 版本。建议安装 550 或 535 系列驱动,重启后重新测试。
- 清理或重装 Ollama CUDA 库:若旧版本恢复正常,可对比新旧安装包中
cuda_v*目录差异;需要时手动复制旧版cuda_v11目录(若存在)到新版本目录。 - 关闭 Vulkan 选项:临时设置
OLLAMA_VULKAN=false(在服务文件中修改Environment),排除 Vulkan 干扰。
验证方法
修改后重启 Ollama 服务(systemctl restart ollama),在 journalctl -u ollama -f 中观察日志。若不再出现 skipping CUDA device 且出现 inference compute 或类似表示 GPU 加载成功的消息,再执行 ollama run 模型名 测试推理速度;也可用 nvidia-smi 观察 llama-server 进程是否正确占用 GPU 显存。
参考来源
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
这个方案解决了吗?
可以继续搜索完整报错,或查看同一工具的其他排查指南。


