MiniMax H3 开源视频模型发布:手绘即特效,视频后期进入「Coding时刻」
7月31日,MiniMax 正式发布新一代视频模型 H3——首个开源视频模型,在 Artificial Analysis 榜单上斩获视频编辑第一。默认 2K 清晰度,支持手绘特效、文字生成、全模态输入,价格仅为主流模型的 1/3。
7月31日,MiniMax 正式发布新一代视频模型 H3——首个开源视频模型,在 Artificial Analysis 榜单上斩获视频编辑第一。默认 2K 清晰度,支持手绘特效、文字生成、全模态输入,价格仅为主流模型的 1/3。
注:榜单柱形为示意对比,精确排名以 Artificial Analysis 官方为准。H3 是前五名中唯一开放权重的模型,也是首个开源视频模型登上该榜第一。
过去一年,视频模型因 Scaling 红利获得突飞猛进,但有一项定位未曾变化:它们只负责为你提供「一段素材」。
素材生成后,你还得拖进 PR 里加字幕、调色、做转场、配音乐、套模板……后面还有「一万件」事在等着你。
但 H3 彻底打破了这个范式。
只生成原始素材 → 用户自行剪辑、加字幕、调色、配乐 → 多人协作,流程冗长。
输入一段文本 → 模型直接输出可发布的成品:剪辑、字幕、转场、特效、BGM 全部端到端集成。
一个诚实的注脚:
文字生成尚未 100% 完美,但已进入商用门槛。精准编辑仍有提升空间——然而,从「玩具」到「工具」的跨越,已经完成。
花体字、字幕动画、视觉特效全部端到端生成,无需任何后期软件。输入一句描述,特效直接「长」在画面上。
每帧文字一致,不崩坏。能理解文字与画面的关系——光影、景深、动态跟随,而非简单叠加。可做歌词 VJ、品牌物料。
文字、图片、音频、视频——所有素材都是模型理解上下文的一部分。传一张参考图胜过写三百字描述。
注:三大能力排序按用户感知冲击力与商业化潜力综合评估。「全模态输入」是底层能力,支撑前两者的实现。
H3 的一切能力,可以归因到同一个第一性原理:多模态 + 语言的涌现。
图像、视频、音频这些自然模态紧密交织,承载海量信息。而语言,正是连接这些多模态孤岛最好的桥梁。
具体来说,团队做了三件事:
注:上下文 Caption 技术大幅拓宽了传统 Caption 的含义——不再只描述目标视频,而是同时刻画上下文与目标视频的关系,甚至理清上下文内部各元素之间的关联。
MiniMax 自创立之初便坚定布局多模态产品矩阵。H3 的发布,是此前多模态技术沉淀的集大成,也是团队基因和传统的又一次延续。
H3 这样一款 SOTA 级的视频模型,选择了开源。
这对有内容需求的企业来说,意义不言而喻。如果仅依赖云端 API,谁也不敢轻易将资产上传至第三方服务器。但一个可私有部署的模型,意味着能够毫无顾忌地用自有数据进行微调,围绕核心 IP、品牌画风与专属内容工作流进行深度定制。
技术与成本的门槛双双降低,H3 的开源,极有可能带来一场 IP 生命力的全面爆发。
从文本模型 M2 系列开始,MiniMax 每一代模型都在拓展开源的边界。如今 H3 将这条路铺进了视频生成的深水区。
回看这个 7 月:如果说 Kimi K3 扛起了 Coding 的开源大旗,那么 MiniMax H3 则在视频模型的赛道上,毅然立起了另一面旗帜。
中国开源的声音,这不是第一次响起。
也绝不会是最后一次。
视频生成正式进入「Coding时刻」——从「提供素材」到「交付成品」,范式已被改写。
H3 已全面开放体验,登录官网即可生成你的第一个「手绘即特效」视频。
hailuoai.com → 开始创作