🎬 开源 · 模型发布

MiniMax H3 开源即登顶:有声视频编辑全球第一,16 家芯片首日适配

8 月 3 日,MiniMax 正式开源新一代通用视频模型 H3。该模型在 Artificial Analysis 有声视频编辑榜单中以 1130 分 Elo 位列全球第一,领先 Gemini Omni Flash 与 Wan 2.7。与开源同步,华为昇腾、AMD、Intel 等 16 家芯片及平台完成首日适配。

来源:综合公开信息整理 2026-08-03 全文约 4 分钟读完
#MiniMax H3 #视频生成 #开源 #有声视频 #全模态
🥇 全球第 1 Artificial Analysis 有声视频编辑榜单
1130 Elo 评分,领先第二名
16 家芯片及平台首日适配

⚡ 30 秒速览

  • 赢了谁:1130 分 Elo 登顶有声视频编辑榜,超越 Gemini Omni Flash、HappyHorse-1.0、Wan 2.7 等国内外模型。
  • 能做什么:统一理解文本、图像、视频与音频,生成最长 15 秒、最高 2K 分辨率、带原生立体声的视频。
  • 怎么做到的:三模块架构——H3-Context-IR 理解指令,H3-Base 生成音视频,H3-Regenerate-2K 重绘 2K 画面。
  • 生态多广:华为昇腾、AMD、Intel、Hugging Face、ComfyUI 等 16 家伙伴首日完成适配,支持本地部署与云端调用。
  • 实测表现:自然风光、广告宣传等任务画面自然度与风格一致性较好,但建筑细节与多镜头编排仍有提升空间。

01有声视频编辑全球 Top 5 MiniMax H3 位居榜首

🥇 MiniMax H3MiniMax
1130
Gemini Omni FlashGoogle
1095
HappyHorse-1.0
1078
Wan 2.7
1050
Kling 1.6
1025

注:柱形自 1000 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 35 分,与第五名分差 105 分。

02H3 是什么?一个全模态生成系统

MiniMax H3 不是一个单纯的视频模型,而是一个通用型全模态生成系统。它能够统一理解文本、图像、视频和音频组成的多模态上下文,并生成最长 15 秒、最高 2K 分辨率、带有原生立体声音频的视频。

传统视频模型

通常只处理文本到视频的单一映射,音频需后期合成,多模态理解能力有限。

MiniMax H3

原生支持文本、图像、视频、音频联合输入与输出,音频与画面同步生成,无需后期。

15秒最长生成
2K最高分辨率
32kHz立体声音频
11种稳定支持语言

支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种画面比例,输出帧率 24FPS。

更关键的是,H3 的 2K 输出并非依赖传统的超分辨率模块,而是通过 H3-Regenerate-2K 让基础模型结合原始上下文重新生成。这种方式能更好地还原小文字和精细纹理。

03实测:自然风光与商业广告,它表现如何?

🏔️ 15 秒风光航拍:雪山草地真实,但建筑有 AI 感画面自然度较高

  • 成片质量:雪山、草地等自然景观较为真实,色彩与光影自然。
  • 镜头运动:航拍长镜头保持了较好的视觉连贯性,无明显卡顿。
  • 明显不足:画面中的寺庙建筑仍有较明显的 AI 生成感,纹理细节不够真实。
评分维度:画面真实感 / 镜头连贯性 / 色彩一致性 / 细节还原 —— 自然场景表现优秀,建筑细节扣分。

🥤 奶茶 × 游戏 IP 广告:叙事清晰,但镜头重复风格统一,编排有瑕

  • 叙事结构:6 个分镜头,整体叙事顺序较为清楚,广告氛围基本统一。
  • 风格一致性:画面风格和品牌调性保持了一致,色彩搭配和谐。
  • 硬伤:多镜头编排出现明显重复——店员向顾客递出奶茶的动作被连续呈现了两次。
LLM 评审结论:「风格一致性优秀,但镜头编排逻辑需优化」

一个诚实的注脚:

H3 在画面自然度、镜头组织和整体风格一致性方面展现出较高完成度,但在建筑细节还原、多镜头编排逻辑上仍有提升空间。它不是完美的,但已经是开源模型里最接近商用级的产品。

04三模块协同:从指令理解到 2K 输出

H3 系统由三个模块组成,各司其职:

H3-Context-IRH3-BaseH3-Regenerate-2K

H3-Context-IR 是一套托管式预处理与编排系统,负责理解文本、图像、音频和参考视频之间的关系。它包含指令解析、跨模态关联、时序理解和复杂逻辑推理。该模块暂未开源,但 MiniMax 提供了 API 和提示词指南。

H3-Base 是实际的音视频生成引擎。文本由 H3-Encoder 编码,视觉素材经过 H3-Encoder 和 H3-VisualVAE 处理,音频由 H3-AudioVAE 编码。不同模态的信息被组织成统一序列,输入 H3-Omni-Transformer。

H3-Regenerate-2K 负责 2K 分辨率输出。它不采用传统的超分辨率模块,而是让基础模型结合原始文本及多模态参考素材,对已生成的 768p 视频重新生成。这种方式能更好地还原小文字和精细纹理。

开发者可以在本地部署 H3-Base 生成 768p 音视频,完整 2K 工作流则需要结合官方 API。

05开源的意义:生态比模型更重要

MiniMax H3 此次开源,不仅是开放了模型权重。与开源同步,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 等 16 家芯片厂商及开发社区完成了首日适配。

这意味着什么?

开发者可以从 Hugging Face 下载模型,通过 SGLang、vLLM、diffusers、ComfyUI 等框架部署,在国产芯片上运行。全模态视频模型的竞争,正从单一画面效果延伸至声音生成、复杂指令理解和产业生态建设

编辑核心判断

开源模型的能力边界正在快速逼近闭源产品,但真正的分水岭不在于单点指标,而在于生态适配的广度与深度——16 家芯片首日适配,才是 H3 最值得关注的信号。

现在就能用

模型已开源,支持本地部署与云端调用。体验地址:海螺 AI(hailuoai.com)或 MiniMax Hub(hub.minimaxi.com)。

Hugging Face 模型仓库 → 下载 H3