MiniMax H3 开源即登顶:有声视频编辑全球第一,16 家芯片首日适配
8 月 3 日,MiniMax 正式开源新一代通用视频模型 H3。该模型在 Artificial Analysis 有声视频编辑榜单中以 1130 分 Elo 位列全球第一,领先 Gemini Omni Flash 与 Wan 2.7。与开源同步,华为昇腾、AMD、Intel 等 16 家芯片及平台完成首日适配。
8 月 3 日,MiniMax 正式开源新一代通用视频模型 H3。该模型在 Artificial Analysis 有声视频编辑榜单中以 1130 分 Elo 位列全球第一,领先 Gemini Omni Flash 与 Wan 2.7。与开源同步,华为昇腾、AMD、Intel 等 16 家芯片及平台完成首日适配。
注:柱形自 1000 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 35 分,与第五名分差 105 分。
MiniMax H3 不是一个单纯的视频模型,而是一个通用型全模态生成系统。它能够统一理解文本、图像、视频和音频组成的多模态上下文,并生成最长 15 秒、最高 2K 分辨率、带有原生立体声音频的视频。
通常只处理文本到视频的单一映射,音频需后期合成,多模态理解能力有限。
原生支持文本、图像、视频、音频联合输入与输出,音频与画面同步生成,无需后期。
支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种画面比例,输出帧率 24FPS。
更关键的是,H3 的 2K 输出并非依赖传统的超分辨率模块,而是通过 H3-Regenerate-2K 让基础模型结合原始上下文重新生成。这种方式能更好地还原小文字和精细纹理。
一个诚实的注脚:
H3 在画面自然度、镜头组织和整体风格一致性方面展现出较高完成度,但在建筑细节还原、多镜头编排逻辑上仍有提升空间。它不是完美的,但已经是开源模型里最接近商用级的产品。
H3 系统由三个模块组成,各司其职:
H3-Context-IR 是一套托管式预处理与编排系统,负责理解文本、图像、音频和参考视频之间的关系。它包含指令解析、跨模态关联、时序理解和复杂逻辑推理。该模块暂未开源,但 MiniMax 提供了 API 和提示词指南。
H3-Base 是实际的音视频生成引擎。文本由 H3-Encoder 编码,视觉素材经过 H3-Encoder 和 H3-VisualVAE 处理,音频由 H3-AudioVAE 编码。不同模态的信息被组织成统一序列,输入 H3-Omni-Transformer。
H3-Regenerate-2K 负责 2K 分辨率输出。它不采用传统的超分辨率模块,而是让基础模型结合原始文本及多模态参考素材,对已生成的 768p 视频重新生成。这种方式能更好地还原小文字和精细纹理。
开发者可以在本地部署 H3-Base 生成 768p 音视频,完整 2K 工作流则需要结合官方 API。
MiniMax H3 此次开源,不仅是开放了模型权重。与开源同步,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 等 16 家芯片厂商及开发社区完成了首日适配。
这意味着什么?
开发者可以从 Hugging Face 下载模型,通过 SGLang、vLLM、diffusers、ComfyUI 等框架部署,在国产芯片上运行。全模态视频模型的竞争,正从单一画面效果延伸至声音生成、复杂指令理解和产业生态建设。
开源模型的能力边界正在快速逼近闭源产品,但真正的分水岭不在于单点指标,而在于生态适配的广度与深度——16 家芯片首日适配,才是 H3 最值得关注的信号。
模型已开源,支持本地部署与云端调用。体验地址:海螺 AI(hailuoai.com)或 MiniMax Hub(hub.minimaxi.com)。
Hugging Face 模型仓库 → 下载 H3