[ISSUE]: TextGen Fails to load GGUF models on multiple browsers, different textgen versions.

这个报错通常出现在 Ubuntu 桌面环境下用 TextGen WebUI 或 Linux 便携包(Electron 桌面版)加载 GGUF / mmproj 模型时,前端 GUI 能打开但模型加载进程崩溃或提示加载失败。优先排查 Electron 启动链路与本地 build 版本(4.7.x)是否

快速结论:这个报错通常出现在 Ubuntu 桌面环境下用 TextGen WebUI 或 Linux 便携包(Electron 桌面版)加载 GGUF / mmproj 模型时,前端 GUI 能打开但模型加载进程崩溃或提示加载失败。优先排查 Electron 启动链路与本地 build 版本(4.7.x)是否已修复,再核对 CUDA build 与驱动版本是否匹配。

适用环境:Issue 中确认的环境为 Ubuntu 24.04.4 LTS GNOME,16GB RAM,NVIDIA GeForce RTX 2060(显存约 5737 MiB,compute capability 7.5),驱动 v580.142,CUDA 13.0;尝试的 TextGen 版本包括 Cuda13 v4.6.2、v4.5.2,以及便携包 4.7-linux-cuda13.1、4.7.1-linux-cuda13.1、4.7.1-linux-cuda12.4、4.7.3;Python 环境涉及 python -m venv、uv venv,便携环境使用 Python 3.13,干净安装使用 CPython 3.12.12。

最快修复方案:暂无确认的一步修复方案。Issue 中确认的修复只覆盖了 Electron 的 SUID sandbox 崩溃:4.7 在 Linux 上的桌面应用 bug 已在 4.7.1 修复(对应 commit d764aaf),升级到 4.7.1 及更高版本后不再出现该 sandbox 报错。模型加载失败的 “Failed to load …gguf” 在 4.7.3 上仍未解决,因此不能把升级版本当作模型加载问题的修复方案。

注意事项:Issue 被关闭,但并未给出针对 GGUF 加载失败的最终根因或验证过的修复;llama.cpp server 以 exit code -11 退出属于底层崩溃,可能与显卡/驱动/CUDA build 组合或模型本身有关,但讨论中没有确认。不要把“CUDA 13.1 build 不能用于 CUDA 13.0 驱动,改用 12.4 build”当作结论——作者试了 12.4 build 后仍遇到同类 Electron 报错,随后才被引导到 4.7.3;也不要在 root 下直接运行 Electron,Issue 中明确出现 “Running as root without –no-sandbox is not supported”。

问题场景

用户在 Ubuntu 24.04 桌面系统上按官方 Multimodal Tutorial 使用 TextGen WebUI,加载 gemma-3-4b-it-Q4_K_S.gguf 及其配套 mmproj-gemma-3-4b-it-F16.gguf 时,界面提示 Failed to load gemma-3-4b-it-Q4_K_S.gguf.。换用更小的模型(甚至 20MB 级别)后问题依旧,说明显存不足不是唯一原因。

此后用户改试 Linux 便携版:先拿 4.7 与 4.7.1 的 cuda13.1 包,启动直接触发 Electron sandbox 崩溃;按建议换成 4.7.1 的 cuda12.4 包,无论用 uv venv 还是 python -m venv,仍出现同样的 SUID sandbox 报错;用 sudo ./textgen 则变成 root 不允许运行。升级到 4.7.3 后 GUI 能启动,但加载 gemma-3-4b-it-Q4_K_S.gguf 仍失败,终端显示 llama.cpp server 异常退出。

报错原文

[ISSUE]: TextGen Fails to load GGUF models on multiple browsers, different textgen versions.

Failed to load gemma-3-4b-it-Q4_K_S.gguf.

[88464:0502/201036.132286:FATAL:sandbox/linux/suid/client/setuid_sandbox_host.cc:166] The SUID sandbox helper binary was found, but is not configured correctly. Rather than run without sandboxing I'm aborting now. You need to make sure that /home/user1/Development/Apps/textgen/app/electron/chrome-sandbox is owned by root and has mode 4755.
Trace/breakpoint trap (core dumped)

[0502/224206.703030:FATAL:electron/shell/app/electron_main_delegate.cc:221] Running as root without --no-sandbox is not supported.

ERROR    Error loading the model with llama.cpp: Server process terminated unexpectedly with exit code: -11

原因分析

Issue 中实际出现的是两类独立问题,需要分开看:

  • Electron 桌面应用启动崩溃:4.7 版本在 Linux 上存在已确认的 bug,导致 chrome-sandbox 的 SUID 权限检查失败并以 Trace/breakpoint trap 退出。4.7.1 修复了该问题(对应 commit d764aaf)。
  • GGUF 模型加载失败:这是用户最初报告的核心问题,在 4.6.2、4.5.2、4.7.3 以及干净安装等多套环境下重复出现。终端日志显示 llama.cpp 的 CUDA backend 已加载、已识别到 RTX 2060,随后 server 进程以 exit code -11 退出。可能原因包括 llama.cpp / GGUF 模型与当前 build 的兼容性、CUDA build 与驱动组合、模型文件本身或 mmproj 配套文件的加载路径,但 Issue 讨论中没有给出确认的根因。

关于 “CUDA 13.1 build 不适用于 CUDA 13.0 驱动、改用 12.4 build” 的说法,Issue 中只是建议,用户照做后仍遇到 Electron 报错,因此不能作为最终结论。

环境排查

  • 确认当前 TextGen 版本:4.7 存在 Linux 桌面 bug,4.7.1 起修复;4.7.3 已能打开 GUI 但模型加载仍失败。
  • 确认是 WebUI 启动方式还是 Linux 便携包(Electron 桌面版),两者报错链路不同。
  • 确认 GPU:NVIDIA GeForce RTX 2060,compute capability 7.5,显存约 5737 MiB。
  • 确认驱动与 CUDA 工具链:Issue 中为 Driver v580.142、CUDA v13.0。
  • 确认下载的 build 类型:cuda13.1 与 cuda12.4 分别属于不同 release 资产,需与本地环境匹配。
  • 确认 Python 环境:Issue 中涉及 Python 3.13(portable_env)和 CPython 3.12.12(uv venv)。
  • 确认是否在 root 下运行,以及是否手动运行过 venv 与便携脚本。
  • 确认是否用干净安装复现:Issue 中删除了 user_data 并替换为原始设置后问题仍存在。

解决步骤

  1. 先区分报错类型:如果启动时出现 SUID sandbox helper binary 或 Running as root without --no-sandbox is not supported,说明是 Electron 桌面启动问题;如果界面能打开但提示 Failed to load ...gguf,属于模型加载问题。
  2. 针对 Electron sandbox 崩溃:把 TextGen 从 4.7 升级到 4.7.1 或更高版本。Issue 中确认 4.7 的 Linux bug 已在 4.7.1 修复(commit d764aaf)。
  3. 不要再手动修改 chrome-sandbox 的所有权或权限(例如 chown root / chmod 4755),也不要为了绕过而用 sudo ./textgen,Issue 中明确显示 root 下运行会被拒绝。
  4. 如果按建议尝试 cuda12.4 build:可以使用 uv venv 或 python -m venv 建立干净环境后运行,但要预期这只针对 Electron 启动问题,不一定解决 GGUF 加载失败。
  5. 如果升到 4.7.3 后 GUI 正常、但加载模型仍失败:查看终端中 llama.cpp 日志,确认 backend 加载、显存识别、模型路径与 mmproj 是否配对;Issue 中 Server process terminated unexpectedly with exit code: -11 表示底层进程崩溃,需要结合具体模型和 CUDA build 进一步定位。
  6. 为排除模型或 mmproj 问题,可换用体积更小、格式明确的 GGUF 单独加载(不带 mmproj),观察是否同样出现 exit code -11,以便缩小到模型侧还是运行时侧。

验证方法

Electron 侧:升级到 4.7.1 或更高版本后重新启动 ./textgen,确认不再出现 SUID sandbox helper binary 或 Running as root without --no-sandbox,并且 GUI 能稳定打开。模型侧:从 WebUI 模型列表中选择目标 GGUF(含 mmproj 时一并选择),观察界面是否还提示 Failed to load ...gguf;同时查看终端中 llama.cpp 日志,确认 server 是否正常启动而不再以 exit code -11 退出。

需要注意:Issue 结束时模型加载失败问题未被确认解决,因此即使按上述步骤操作,也不能保证 GGUF 一定能加载成功。

参考来源

oobabooga/textgen #7530

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 25903

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注