AI·快讯
🎬 全模态 · 模型发布

2K画质,三成价格!MiniMax H3全模态模型发布,统一文本/图像/视频/声音生成

7月31日,MiniMax发布通用全模态生成模型H3,支持同时输入文本、图像、视频和声音,最高输出15秒2K音视频。2K分辨率下每秒价格不到主流模型的1/3,在Artificial Analysis文生视频有声榜单中排名第二,Elo得分1242。

综合公开信息整理 2026-07-31 全文约3分钟读完
#MiniMax #H3 #全模态 #视频生成 #2K
🥈 第二 · 1242 Elo 文生视频有声榜单 · 与第一名仅差3分
2K · 15 最高分辨率与时长,原生双声道
< 1/3 价格 2K分辨率下每秒价格不到主流模型1/3

⚡ 30秒速览

  • 核心能力:统一理解文本、图像、视频、声音,输出带原生双声道的2K音视频,最长15秒。
  • 价格杀伤:2K下每秒价格不到主流模型1/3,768P下不到1/2,行业最优性价比。
  • 榜单验证:Artificial Analysis文生视频有声榜单第二,1242 Elo,距榜首仅3分。
  • 技术底色:四项创新——Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration。
  • 开源承诺:未来几天内开放模型权重,推动国产芯片适配与开源生态。

01文生视频有声榜单 Top 2 MiniMax H3 位居第二,距榜首仅3分

🥇 谷歌 Gemini Omni FlashGoogle
1245
🥈 MiniMax H3MiniMax
1242

注:柱形宽度反映Elo相对比例,MiniMax H3与第一名仅差3分,竞争极为接近。榜单由Artificial Analysis发布,专注文生视频有声任务。

这个排名的含金量在于:有声视频生成同时考验画面质量、音画同步、人声与音效的联合生成能力,是当下视频模型最难攻克的场景之一。H3以1242分跻身第一梯队,且与谷歌旗舰模型分差极小。

02从任务隔离到全模态统一 用语言连接一切

过往生成模型擅长"单线操作"——文生图、图生视频、音色参考各自独立,用户需要在不同工具间反复搬运素材。H3的设计哲学是:打破边界,让模型理解完整的创作意图。

传统生成管线

文生图、图生视频、音色参考、动作迁移……彼此隔离,用户被迫在多个工具间切换,素材组合受限。

MiniMax H3

全模态统一建模,文本、图像、视频、声音一同输入,自然语言描述所有参考与编辑关系,模型自主理解并执行。

四项核心技术,支撑这场统一。

CORContextual Omni
Representation
10万→4K Token
H3-VAE
序列长度收益
降低训练成本
+30%H3-Omni Transformer
异构训练架构
吞吐提升
2KIn-context
Regeneration
基模复用生成

注:COR用语言压缩多模态上下文;H3-VAE提升视觉压缩率4倍;H3-Omni Transformer优化异构负载;In-context Regeneration无需独立超分模块即可输出2K。

MiniMax特别强调,H3在预训练阶段就混合了图像、视频、音频以及多种参考和编辑数据,语言成为连接所有模态的桥梁,而不是为每个任务训练独立的专家模型。

03它到底能生成什么?三个实测案例

🎮 游戏UI交互生成 · 赛博朋克风格 交互流畅

  • 角色打开装备界面,依次进入零部件选择、配置确认和加载页面,最终切换到霓虹灯街道的游戏画面。
  • 整个交互过程衔接流畅,界面反馈自然,营造出色彩丰富的赛博朋克氛围。
  • 镜头切换与UI过渡保持视觉一致性,场景递进逻辑清晰。
评审结论:「交互连贯,风格统一,具备可直接使用的游戏Demo质感」

🎨 动态海报 · 人物冲出海报的立体效果 视觉统一

  • 人物以较小比例出现在粉色矩形底部,随后绿色标题文字从背景中显现。
  • 人物快速放大并向镜头伸手,形成冲出海报的立体效果,全程色彩与视觉风格高度统一。
  • 文字与画面的空间关系处理自然,无撕裂或变形。
评审结论:「动态层次丰富,品牌感强,可直接用于商业海报制作」

🛍️ 广告电商 · 银黑配色的商业质感 具备商业级品质

  • 先后展示模特佩戴银色护目镜的面部特写和侧脸,随后切换至黑白服装模特的全身镜头。
  • 眼镜产品特写与双人定妆画面中,光影、服装和银黑配色保持一致,镜片反光和金属材质突出。
  • 多镜头切换流畅,产品展示逻辑清晰,已具备商业广告的基本质感。
评审结论:「光影统一,材质表现到位,达到电商广告交付标准」

04价格不到三分之一,模型权重即将开放

MiniMax在发布时直接将性价比作为核心卖点——不是"同样价格画质更好",而是"同样画质价格更低"。

2K 分辨率
< 1/3
每秒价格不到主流模型的
三分之一,旗舰画质门槛大幅降低
768P 分辨率
< 1/2
每秒价格不到主流模型的
二分之一,日常使用更具性价比

注:具体价格暂未公布,以上为官方宣称的性价比对标。实际成本需结合使用场景与时长综合评估。

一个诚实的注脚:

价格优势建立在H3-VAEIn-context Regeneration两项技术之上——更高的视觉压缩率和基模复用能力,让2K生成不再需要昂贵的独立超分辨率模块。但实际落地成本能否持续低于竞品,仍需观察规模化部署后的表现。

🔓 开源 MiniMax计划在未来几天内开放模型权重,在符合法律法规的前提下,推动国产芯片适配与开源生态建设。开发者可关注官方渠道获取最新动态。
编辑核心判断

全模态统一生成是AI视频赛道的重要方向,但H3能否兑现承诺,仍要看其在复杂多模态指令稳定性、2K画面精细度、音画同步质量以及真实生成成本等方面的实测表现。统一架构只是第一步,工程落地才是真正的考验。

模型权重即将开放

MiniMax H3已展示出全模态统一生成的技术潜力,定价策略也极具冲击力。
模型权重即将开源,关注 MiniMax 官方发布渠道获取第一手信息。

MiniMax H3 · 全模态生成 2K · 15秒 · 1/3价格