MiniMax H3 发布:2K 画质 15 秒生成,价格仅为行业 1/3,文生视频有声榜全球第二
MiniMax 今日发布通用全模态生成模型 H3,统一理解文本、图像、视频与声音,最高支持 15 秒、2K 分辨率输出,带原生双声道。在第三方评测机构 Artificial Analysis 的文生视频有声榜单中,H3 以 Elo 1242 分位列全球第二,2K 分辨率下每秒价格不到主流模型的 1/3。
MiniMax 今日发布通用全模态生成模型 H3,统一理解文本、图像、视频与声音,最高支持 15 秒、2K 分辨率输出,带原生双声道。在第三方评测机构 Artificial Analysis 的文生视频有声榜单中,H3 以 Elo 1242 分位列全球第二,2K 分辨率下每秒价格不到主流模型的 1/3。
注:柱形长度为相对比例,Elo 分数差异以标注值为准。H3 与榜首分差仅 3 分,属于同一梯队。榜单来自 Artificial Analysis 文生视频有声评测,该评测综合考察视频质量、音频同步、指令遵循等维度。
这份成绩的含金量在于:文生视频有声榜不仅考核画面质量,还要求原生双声道音频(人声、音效、音乐)与画面同步生成,是对「全模态输出能力」的直接检验。H3 是唯一进入前二的国产模型。
MiniMax H3 的定价策略直击行业痛点。在 2K 分辨率下,每秒生成成本不到主流模型的 1/3;768P 下不到 1/2。官方尚未公布具体价格数字,但称「有能力提供行业内最优的性价比」。
但比价格更值得关注的,是 H3 的技术路线选择:
文生图、图生视频、音色参考、动作迁移……每个任务独立训练,模型之间无法共享上下文,用户需要组合多个工具完成创作。
文本、图像、视频、声音统一处理,用自然语言描述跨模态关系。一个模型完成理解 + 生成 + 编辑,无需拆分任务管线。
H3 在预训练阶段就混合了图像、视频、音频及多种参考/编辑数据,让模型从底层学会「多模态上下文理解」,而非后期拼接。
三个案例均来自 MiniMax 官方展示,素材为模型直接生成,未经过后期人工修饰。
MiniMax H3 没有沿用前代 Hailuo-02 的架构,而是重新设计了 H3-Omni Transformer。其技术栈由四个核心模块构成:
用语言同时描述目标视频、参考素材及它们之间的关系。大部分素材消耗约 10 万 Token 推理,最终压缩为平均约 4K Token。
将视觉信息压缩率提升 4 倍序列长度收益,大幅降低训练与推理成本,为 2K 分辨率输出提供底层支持。
采用异构训练架构,优化序列长度方差与负载均衡。端到端训练吞吐提升近 30%,支持理解与生成任务混合计算。
不依赖独立超分模块,基模结合原始多模态上下文重新生成高分辨率画面,更好还原小文字与局部细节。
MiniMax 表示,H3 在复杂多模态理解、模型规模和部分场景的画面精细度上仍有提升空间。后续 H 系列将融合 M 系列模型能力,继续扩大规模与分辨率。
MiniMax H3 用一个统一架构打破了「文生图、图生视频、音色参考、动作迁移」彼此隔离的产品定义。方向正确,但统一不等于完美——复杂多模态指令的稳定性、2K 画面的精细度、音画同步质量,仍需实测验证。H3 真正的价值在于:它把选择权还给了创作者,而不是被工具形态定义。当模型能够同时理解「参考这段视频的镜头运动,让这张图里的人唱歌,声音像这段音频」时,创作的门槛已经从「会用多个工具」降到了「能说清想法」。
MiniMax H3 已开放使用,登录官网即可体验 2K 全模态生成。模型权重即将在符合法律法规的前提下开源,推动国产芯片适配与社区生态建设。
minimaxi.com → 体验 H3也可通过 MiniMax 官方 API 接入,支持广告、电商、游戏、UI/UX 等场景