MiniMax H3 团队 Reddit 被问爆:2K 要开源,图像模型在路上,Apache-2.0 也在考虑了

MiniMax H3 团队在 Reddit 首次系统回应开放权重后的关键问题:2K 模型确认开源、Sparse Attention 参考实现即将发布、官方低步数版本正在考虑,并首次证实正在从 H3 模型谱系派生专门的图像生成模型。

一句话看懂:MiniMax H3 团队在 Reddit 首次系统回应开放权重后的关键问题:2K 模型确认开源、Sparse Attention 参考实现即将发布、官方低步数版本正在考虑,并首次证实正在从 H3 模型谱系派生专门的图像生成模型。

事件核心:发生了什么

8 月 7 日晚,MiniMax H3 团队在 Reddit 的 r/StableDiffusion 社区举行 AMA,研究负责人 dacongya、研究员 Luigi、Nero、Kiro,系统工程师 Reynor 及开发者关系负责人 Ryanlee 共同参与,回答了社区超过 300 条评论中的高热度问题。

H3 是 MiniMax 于 7 月 31 日发布的全模态视频生成模型,支持文本、图像、视频和声音组成的多模态上下文,可生成最长 15 秒、最高 2K 分辨率且带原生双声道的视频。此次 AMA 中,团队确认了几个关键计划:用于最终 2K 输出的 H3-Regenerate-2K 模型会发布,且“不会太久”;近期将提供保守的 Sparse Attention 参考实现,优先保证无感知质量损失而非极端加速;正在积极考虑 4-NFE 或 8-NFE 低步数版本。此外,团队首次披露,正在从 H3 模型谱系的共同祖先模型出发,派生一个专门的图像生成模型,该模型将复用 H3 的 VAE Encoder 架构,并配一个专门设计的 VAE Decoder。

为什么重要

这场 AMA 的意义在于,MiniMax 在开放权重之后第一次系统回应了开发者生态真正关心的问题——不只是“模型在 Benchmark 上超过了谁”,而是训练、推理、工具链和模型能力边界到底能开放到什么程度。从回答来看,H3 没有沿用 M3 上的 MSA,而是采用更接近 MoBA-style 的 Block Selection 方案,且目前仅对视频 Token 做了三维稀疏化,图片和文本 Token 尚未覆盖,这说明后续还有明确的性能释放空间。

同时,图像生成模型的开发方向值得关注。H3 被广泛视为视频生成模型,但 MiniMax 显然希望将这套多模态生成架构延伸到静态图像领域。团队也明确划定了能力边界:H3 不是流式视频生成模型,未来的合理工作流是先用图像模型生成首帧,再交给 H3 的 I2V 模式完成视频扩展。

对用户/开发者/创作者的影响

对开发者而言,H3 目前仍以 Full Attention 推理,显存和算力开销偏大。Sparse Attention 参考实现开放后,本地运行成本可能明显下降,社区基于 Full Attention 测得的效率数字将不再是最终水平。2K checkpoint 的发布也会让本地复现线上画质成为可能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者而言,team 确认了 Ref2Vid 比 I2V 更容易“糊”的问题部分源于模型自身的后训练策略差异,而非完全用户 Prompt 使用不当。官方建议尽可能提供高质量的参考输入。第三方 Turbo LoRA 虽然已出现,但激进降步数会导致运动质量和音频受损,社区测试也发现类似退化,现阶段不能盲目追求低步数。

此外,社区摸索出的“用 H3 生成 5 帧视频再取第一帧”作为图像生成的做法,未来可能被官方图像模型取代,工作流会变得更直接。

值得关注的后续

一是 2K checkpoint 的具体发布日期——团队表示“不会太久”,这是验证 In-context Regeneration 方案能否被社区复现的关键。二是 Sparse Attention 参考实现的实际效果,目前团队的目标只是“无感知质量损失”的保守版本,真正的硬件加速还需要社区适配。三是即将到来的图像模型是否会独立发布,以及它与 H3 的 I2V 工作流能否无缝衔接,这将直接影响多模态创作生态的走向。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 18313

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注