[Bug]: MiniMax-M3 Multimodal Model Crashes During Inference

运行 MiniMax-M3 多模态模型进行推理时发生崩溃,报错为 CUDA illegal memory access。优先排查是否缺少对 MiniMax-M3 的模型架构支持,并尝试应用 vLLM 项目 PR #49149 中的补丁。

快速结论:运行 MiniMax-M3 多模态模型进行推理时发生崩溃,报错为 CUDA illegal memory access。优先排查是否缺少对 MiniMax-M3 的模型架构支持,并尝试应用 vLLM 项目 PR #49149 中的补丁。

适用环境:vLLM;Ubuntu 22.04.5 LTS;Python 3.12.13;PyTorch 2.11.0+cu130;CUDA 13.0;8× NVIDIA H20 GPU;英特爾 Xeon Platinum 8480+ CPU。

最快修复方案:合并或 cherry-pick PR #49149 的代码修改(该 PR 由 @vonchenplus 提交,专门修复 MiniMax-M3 多模态支持),重新编译或在对应版本中应用该改动。

注意事项:该方案已在 Issue 报告者环境中验证有效,但未在其他硬件/软件组合下全面测试。如果没有条件合并整个 PR,可手动检查 vLLM 的模型加载逻辑中是否缺少对 MiniMax-M3 的多模态分支处理。

问题场景

用户使用 vLLM 框架加载 MiniMax-M3 多模态模型(具备文本+图像输入能力)进行推理时,模型初始化或推理过程中立即崩溃,出现 CUDA illegal memory access 错误。

报错原文

CUDA illegal memory access error

原因分析

可能原因:vLLM 在支持 MiniMax-M3 多模态架构时,其内部的多模态分支处理逻辑存在缺陷,导致张量操作访问了未分配的显存区域。PR #49149 专门修正了这一部分代码。

环境排查

  • 确认 Python 版本:3.12.x(Issue 中为 3.12.13)
  • 确认 PyTorch 版本:2.11.0+cu130
  • 确认 CUDA 版本:运行时 13.0,驱动 595.71.05
  • 确认 GPU 型号:NVIDIA H20(多卡)
  • 确认 vLLM 版本:未在 Issue 中明确给出,但应使用合并了 PR #49149 后的代码或对应修复版本
  • 检查是否已正确安装 MiniMax-M3 所需的额外依赖(如有)

解决步骤

  1. 确认当前使用的 vLLM 源码版本,备份后切换到含 PR #49149 修改的分支。
  2. 手动合并 PR #49149 中的代码变更(主要涉及多模态模型加载和推理路径的修正)。
  3. 重新编译 vLLM 或按照官方文档更新 Python 包。
  4. 重新运行 MiniMax-M3 模型的推理脚本。

注意:Issue 中未给出具体的合并命令或版本号,请以 GitHub PR #49149 的 diff 为准。

验证方法

重新加载 MiniMax-M3 模型并执行一次包含文本和图像输入的推理,确认不再抛出 CUDA illegal memory access 错误,且模型能正常返回输出。

参考来源

vllm-project/vllm #49940

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

这个方案解决了吗?

celebrityanime
celebrityanime
文章: 15315

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注