🎬 全模态 · 模型发布

MiniMax H3 发布:2K 画质 15 秒生成,价格仅为行业 1/3,文生视频有声榜全球第二

MiniMax 今日发布通用全模态生成模型 H3,统一理解文本、图像、视频与声音,最高支持 15 秒、2K 分辨率输出,带原生双声道。在第三方评测机构 Artificial Analysis 的文生视频有声榜单中,H3 以 Elo 1242 分位列全球第二,2K 分辨率下每秒价格不到主流模型的 1/3

综合公开信息整理 2026-07-31 全文约 4 分钟读完
#MiniMax #H3 #全模态生成 #文生视频 #2K
🥈 全球第 2 Artificial Analysis 文生视频有声榜 · Elo 1242
2K 最高分辨率 · 15 秒时长
1/3 2K 下每秒价格 vs 主流模型

⚡ 30 秒速览

  • 榜单成绩:Artificial Analysis 文生视频有声榜第二,Elo 1242,仅略低于谷歌 Gemini Omni Flash 的 1245 分。
  • 价格碾压:2K 分辨率每秒价格不到主流模型的 1/3,768P 不到 1/2,官方称「行业内最优性价比」。
  • 全模态统一:文本、图片、视频、声音可同时输入,模型理解跨模态关系并联合生成音视频,支持 V2V 动作迁移。
  • 即将开源:计划在未来几天内开放模型权重,推动国产芯片适配与开源生态。
  • 应用场景:广告、品牌、电商、产品设计、UI/UX、游戏——已具备商业级质感。

01文生视频有声榜 Top 3 MiniMax H3 位居第二

🥇 Gemini Omni FlashGoogle
1245
🥈 MiniMax H3MiniMax
1242
其他模型N/A

注:柱形长度为相对比例,Elo 分数差异以标注值为准。H3 与榜首分差仅 3 分,属于同一梯队。榜单来自 Artificial Analysis 文生视频有声评测,该评测综合考察视频质量、音频同步、指令遵循等维度。

这份成绩的含金量在于:文生视频有声榜不仅考核画面质量,还要求原生双声道音频(人声、音效、音乐)与画面同步生成,是对「全模态输出能力」的直接检验。H3 是唯一进入前二的国产模型。

但榜单只是数据。真正的考验是:它能在真实场景中做什么?

02价格屠夫,也是路线破局者

MiniMax H3 的定价策略直击行业痛点。在 2K 分辨率下,每秒生成成本不到主流模型的 1/3;768P 下不到 1/2。官方尚未公布具体价格数字,但称「有能力提供行业内最优的性价比」。

但比价格更值得关注的,是 H3 的技术路线选择:

传统分任务模型

文生图、图生视频、音色参考、动作迁移……每个任务独立训练,模型之间无法共享上下文,用户需要组合多个工具完成创作。

MiniMax H3 统一全模态

文本、图像、视频、声音统一处理,用自然语言描述跨模态关系。一个模型完成理解 + 生成 + 编辑,无需拆分任务管线。

H3 在预训练阶段就混合了图像、视频、音频及多种参考/编辑数据,让模型从底层学会「多模态上下文理解」,而非后期拼接。

不同素材之间的参考、保留和修改关系,均通过自然语言描述,不被限制在少数预定义任务中。 —— MiniMax

03它能做什么?三个真实场景的答卷

🎮 游戏 UI:赛博朋克交互流 商业级

  • 角色打开装备,依次进入零部件选择、配置确认、加载界面,最终切换到霓虹灯街道的游戏画面。
  • 整个交互过程衔接流畅,界面反馈自然,营造出色彩丰富的赛博朋克氛围。
  • 多镜头之间的光影与风格统一,已具备可落地的游戏资产制作能力。
关键能力:多镜头叙事一致性 + 交互逻辑理解。

🖼️ 动态海报:人物「冲出」画面 品牌创意

  • 画面以人物小比例出现在粉色矩形底部,绿色标题文字从背景中显现。
  • 人物快速放大并向镜头伸手,形成冲出海报的立体效果。
  • 整体色彩与视觉风格统一,文字与主体的空间关系准确。
关键能力:文字与品牌信息呈现 + 动态构图设计。

🛍️ 广告电商:多镜头商业片 高质感

  • 模特佩戴银色护目镜的面部特写 → 侧脸 → 全身镜头 → 眼镜产品特写 → 双人定妆,多镜头切换。
  • 不同镜头之间的光影、服装配色、银黑配色保持一致,镜片反光和金属材质突出。
  • 已具备商业广告的基本质感,可直接用于电商详情页或信息流广告。
关键能力:V2V 动作迁移 + 多镜头材质与光影统一。

三个案例均来自 MiniMax 官方展示,素材为模型直接生成,未经过后期人工修饰。

04技术底牌:四层架构撑起全模态

MiniMax H3 没有沿用前代 Hailuo-02 的架构,而是重新设计了 H3-Omni Transformer。其技术栈由四个核心模块构成:

Contextual Omni RepresentationH3-VAEH3-Omni TransformerIn-context Regeneration

🧠 Contextual Omni Representation

用语言同时描述目标视频、参考素材及它们之间的关系。大部分素材消耗约 10 万 Token 推理,最终压缩为平均约 4K Token。

📦 H3-VAE

将视觉信息压缩率提升 4 倍序列长度收益,大幅降低训练与推理成本,为 2K 分辨率输出提供底层支持。

⚙️ H3-Omni Transformer

采用异构训练架构,优化序列长度方差与负载均衡。端到端训练吞吐提升近 30%,支持理解与生成任务混合计算。

🔄 In-context Regeneration

不依赖独立超分模块,基模结合原始多模态上下文重新生成高分辨率画面,更好还原小文字与局部细节。

MiniMax 表示,H3 在复杂多模态理解、模型规模和部分场景的画面精细度上仍有提升空间。后续 H 系列将融合 M 系列模型能力,继续扩大规模与分辨率。

技术架构的领先是一回事,落到产品上是否可靠是另一回事。
编辑核心判断

MiniMax H3 用一个统一架构打破了「文生图、图生视频、音色参考、动作迁移」彼此隔离的产品定义。方向正确,但统一不等于完美——复杂多模态指令的稳定性、2K 画面的精细度、音画同步质量,仍需实测验证。H3 真正的价值在于:它把选择权还给了创作者,而不是被工具形态定义。当模型能够同时理解「参考这段视频的镜头运动,让这张图里的人唱歌,声音像这段音频」时,创作的门槛已经从「会用多个工具」降到了「能说清想法」。

现在就能用

MiniMax H3 已开放使用,登录官网即可体验 2K 全模态生成。模型权重即将在符合法律法规的前提下开源,推动国产芯片适配与社区生态建设。

minimaxi.com → 体验 H3

也可通过 MiniMax 官方 API 接入,支持广告、电商、游戏、UI/UX 等场景