MiniMax-H3 在 8×H200 上基准测试:无损加速 1.95×,最高 6.24×(SSIM 0.76-0.91)

LMSYS 与 SGLang Diffusion、NVIDIA、蚂蚁集团联合公布了 MiniMax-H3 视频生成模型在 8 张 H200 上的实测加速数据:无损路径提速约 1.95 倍,叠加缓存复用与稀疏注意力后最高可达 6.24 倍加速,但画面相似度(SSIM)会降至 0.76–0.91 区间。

一句话看懂:LMSYS 与 SGLang Diffusion、NVIDIA、蚂蚁集团联合公布了 MiniMax-H3 视频生成模型在 8 张 H200 上的实测加速数据:无损路径提速约 1.95 倍,叠加缓存复用与稀疏注意力后最高可达 6.24 倍加速,但画面相似度(SSIM)会降至 0.76–0.91 区间。

事件核心:发生了什么

8 月 27 日,LMSYS(Chatbot Arena 团队)发布了对 MiniMax-H3 视频生成模型的第三方基准测试。测试固定提示词、随机种子、分辨率(1344×768)、帧率(24 FPS)与去噪步数(50 步),在 8× NVIDIA H200(141 GB)环境下,对比 Diffusers 与 SGLang Diffusion 两种推理运行时。

结果显示:SGLang 的无损稠密路径比 Diffusers 快 1.85–1.95 倍(5 秒视频从 74.34 秒降至 39.67 秒,10 秒视频从 207.71 秒降至 112.44 秒),且不引入任何近似计算。进一步叠加 Cache-DiT(跨去噪步骤复用结果)与 SubBlock 稀疏注意力(跳过低于阈值的注意力块)后,最快配置在 10 秒 FL2VA 任务上达到 6.24 倍加速,但平均 SSIM 降至 0.76–0.91。

测试还给出了质量优先与均衡配置的建议:单独使用 Cache-DiT 可获得最高 2.99 倍加速且 SSIM 保持在 0.90–0.92;SubBlock 0.75 + Cache-DiT stride 组合则提供 4.90–5.93 倍加速,SSIM 在 0.79–0.90 之间。该基准所有配置均可在 SGLang cookbook 页面复现。

为什么重要

这份报告的价值在于把视频生成的加速手段拆解为三个可叠加的独立层:融合内核(无损,单点微基准最高 12.16 倍)、步骤复用(有损)与稀疏注意力(有损),并首次用统一指标(SSIM)量化了它们组合时的质量代价。视频扩散模型的两大成本瓶颈——反复执行的去噪循环与超长序列注意力——恰好被这三层分别针对,因此该测试方法有望成为后续视频推理优化的标准评估框架。

对行业而言,6.24 倍加速意味着在相同硬件上可将视频生成吞吐提升一个数量级(叠加约 2 倍运行时优势后),直接降低单次生成的算力成本。这也反映出推理优化在扩散模型领域的竞争已从图像延伸至视频,SGLang Diffusion 正试图以“可调节的损失路径”作为差异化卖点,而 Diffusers 作为默认基线在长视频任务上的性能差距已十分明显。

对用户/开发者/创作者的影响

开发者:SGLang Diffusion 已为 MiniMax-H3 提供带精确启动参数的 cookbook 页面,所有配置均可复现。需要平衡速度与质量的团队可直接采用“Cache-DiT conservative”作为质量优先默认配置,或使用“SubBlock 0.75 + Cache-DiT stride”作为均衡配置,无需自行调参。但需注意有损路径的效果依赖具体提示词与内容类型,上线前应针对自身场景验证 SSIM。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

创作者/工作室:若使用 MiniMax-H3 生成短视频素材,在 8× H200 环境下,无损路径可让 5 秒视频等待时间从约 74 秒缩短至 40 秒;接受轻微质量损失时(SSIM 0.90 以上),可进一步降至 28 秒。对于批量生成或实时预览场景,这意味着工作流效率的实质性提升。

算力采购方:数据显示有损路径的加速收益并不均匀——T2VA 任务在最高加速档位下 SSIM 降至 0.76–0.78,而 FL2VA 仍保持 0.85–0.91。这意味着选择加速配置时应结合应用场景对时间一致性与内容保真度的要求,而非一律追求最大加速比。

值得关注的后续

1. 量化与渐进式分辨率未纳入本次测试:报告明确提到 SGLang Diffusion 还支持更多有损路径(量化、渐进式分辨率),当前数据只是可用优化空间的一部分。后续若补齐这些档位的 SSIM 数据,可能刷新加速上限。

2. 官方 MiniMax 推理栈是否会跟进:此次测试由 SGLang/NVIDIA/蚂蚁主导,MiniMax 官方对第三方优化路径的态度——是吸收进自家服务、保持距离还是推出竞品方案——将影响该优化栈的实际采用范围。

3. 质量指标与主观体验的差距:SSIM 0.76 是否可接受,最终取决于视频内容类型与观看场景。报告附带了演示片段供人工判断,建议关注社区对这些有损输出的主观评价,而非只看数值。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 20695

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注