gemma4 mlx capabilities

这个报错通常发生在使用 Ollama 加载 Gemma4 系列 MLX 格式模型时,发现模型卡片宣称的多模态能力(vision、audio)没有出现在 ollama show 的 Capabilities 列表中。优先排查方式是确认 Ollama 版本是否已更新到包含 MLX 视觉/音频支持补丁的版

快速结论:这个报错通常发生在使用 Ollama 加载 Gemma4 系列 MLX 格式模型时,发现模型卡片宣称的多模态能力(vision、audio)没有出现在 ollama show 的 Capabilities 列表中。优先排查方式是确认 Ollama 版本是否已更新到包含 MLX 视觉/音频支持补丁的版本(该功能已合并)。

适用环境:macOS(Apple Silicon)、Ollama 0.30.7(问题报告版本);官方 gemma4:12b-mlx 以及自定义 MLX 转换的 Gemma4 31B 模型均受影响。

最快修复方案:暂无确认的一步修复方案,但问题根因已定位为 MLX runtime 当时仅支持文本。官方已合并 MLX Gemma4 vision 和 audio 支持的 PR,因此推荐升级 Ollama 到包含该补丁的最新版本并重新拉取/导入模型。

注意事项:该修复 PR 是在 Issue 关闭后合并的,本文无法验证具体版本号;If 升级后仍无效,请检查模型是否为重新转换而非旧缓存。

问题场景

用户在 macOS(Apple Silicon)上通过 Ollama 使用 Gemma4 模型。官方 gemma4 模型卡页面 标注该模型支持 visiontoolsthinkingaudio,但执行 ollama show gemma4:12b-mlx 时,Capabilities 仅显示 completiontoolsthinking,缺少视觉和音频能力。

报错原文

ollama show gemma4:12b-mlx
...

  Capabilities
    completion
    tools
    thinking

  Parameters
...

原因分析

根据维护者回复,最可能的原因是:当时 Ollama 的 MLX runner(专门用于 Apple Silicon 的运行时)仅支持文本处理(text only),尚未实现视觉和音频的推理支持。因此即使模型权重中包含视觉塔(vision tower)和音频相关层,MLX 运行时也无法识别/注册这些能力。

评论中也确认,这并非模型大小特定问题——自定义转换的 Gemma4 31B MLX 模型同样无法显示 vision/Projector 能力,说明是 MLX 导入链路整体未处理多模态组件的注册。

是否已修复:Issue 关闭后,评论中贴出的 PR(ollama/ollama#17487)已将 MLX Gemma4 vision 和 audio 支持合并,表明根因已解决。

环境排查

  • 确认 Ollama 版本:ollama --version(问题版本为 0.30.7)
  • 确认 macOS 和 Apple Silicon 芯片类型(M 系列)
  • 如为自定义转换模型,确认转换时是否跳过/包含 PLE、vision、audio 层(评论提到为避免 u32 反量化崩溃,某些量化补丁会跳过这些层)
  • 若使用 GGUF 格式对比测试,确认相同 checkpoint 在 GGUF 导入下能正常显示 vision 和 Projector

解决步骤

  1. 升级 Ollama 到最新版本:由于 MLX Gemma4 vision/audio 支持已合并到主分支,优先尝试升级到包含该补丁的版本(可关注 Release 说明)。
  2. 重新拉取或重新导入模型:升级后重新执行 ollama pull gemma4:12b-mlx(官方模型)或使用原 Modelfile 重新 ollama create(自定义模型),避免旧缓存。
  3. 验证能力列表:重新运行 ollama show gemma4:12b-mlx,检查 Capabilities 是否已包含 visionaudio
  4. 若仍无效:由于升级后缺少明确的全量回归测试报告,可检查模型的 safetensors 元数据中是否完整包含 vision_towerembed_vision 权重以及 vision_config 块(参考 Issue 评论中确认这些权重在原始转换中其实已存在)。

验证方法

确认问题已解决的方法是:ollama show 输出中 Capabilities 列表应包含 visionaudio;对于自定义模型,还应出现 Projector 区块(对比 GGUF 导入时的输出)。此外可尝试向模型发送图片进行实际的多模态推理测试。

参考来源

ollama/ollama #16700: gemma4 mlx capabilities

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 21563

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注