MiniMax H3 登顶视频编辑榜,价格仅为 Seedance 三分之一,宣布开源
7 月 22 日,MiniMax 发布视频旗舰模型 H3,以 1130 Elo 登顶 Artificial Analysis 视频编辑榜,力压 Google Gemini Omni、字节 Seedance 2.0 等模型。价格仅为 Seedance 2.0 的 三分之一,且即将开源——这是第一个达到旗舰水平的开源视频模型。
7 月 22 日,MiniMax 发布视频旗舰模型 H3,以 1130 Elo 登顶 Artificial Analysis 视频编辑榜,力压 Google Gemini Omni、字节 Seedance 2.0 等模型。价格仅为 Seedance 2.0 的 三分之一,且即将开源——这是第一个达到旗舰水平的开源视频模型。
Artificial Analysis 最新视频编辑排行榜中,MiniMax H3 以 1130 Elo 占据榜首。榜单涵盖 Google Gemini Omni、字节 Seedance 2.0、Runway Gen-4 等数十个模型,H3 在画面编辑、文字稳定、多模态一致性等维度上综合领先。
注:Elo 评分基于 Artificial Analysis 视频编辑专项榜单,分数越高代表综合编辑能力越强。价格对比为 H3 与 Seedance 2.0 的 API 推理成本比值,非终端定价。
但榜单排名只是冰山一角。真正让行业侧目的,是 H3 将旗舰级模型能力与 1/3 的推理成本结合在一起。对于需要高频生成、快速迭代的商业场景(广告创意、电商展示、短剧制作),这意味着单位内容的生成成本大幅下降,试错空间显著扩大。
画质与一致性优秀,但价格较高;企业需通过 API 调用,数据需上传至第三方,存在隐私顾虑。
效果比肩 Seedance 2.0,价格仅为 1/3;支持私有化部署,数据不出域,可定制微调。
注:对比基于公开评测与官方定价信息,实际效果因场景而异。H3 开源后企业可自行部署测试。
H3 不是"又一个能生成视频的模型"。它的核心差异在于:把视频生成从素材级推向交付级。以下三项能力,每一件都是商业视频生产中的真实痛点。
把分散在后期流程中的能力塞进一个模型——这是 H3 最直接的"交付级"信号。
H3 的技术目标很明确:任务的统一与泛化。它用语言作为桥梁,将文生图、图生视频、视频编辑、声音生成等能力纳入同一个预训练范式,而非堆叠多个专家模型。
四块技术拼图各司其职:
Contextual Omni Representation 增强多模态描述能力,让模型理解素材之间、素材与目标之间、画面与声音之间的关系 —— 这是"全模态上下文"的根基。
H3-VAE 升级视频 tokenizer,在重建质量和压缩效率上获得 4 倍序列长度收益,是 H3 支持 原生 2K 输出 的关键。
H3-Omni Transformer 采用理解与生成异构的训练架构,通过样本间负载均衡将端到端训练吞吐提升近 30%。
In-context Regeneration 与传统专用超分模块不同,让基模基于低分辨率结果和上下文信息重新生成 2K 细节,提升小文字、纹理和画面细节的还原能力。
注:技术细节引自 MiniMax 官方技术博客,四项技术共同构成 H3 的"统一泛化"能力基础。
要理解 H3 的位置,得先看过去十多年视觉内容生产工具的跃迁。H3 所处的节点,正是视频模型从 素材生成走向商业级成片交付 的关键拐点。
一条十几秒的广告短片需要设计、剪辑、后期、动画师等多角色协同,制作成本极高。能力足够强,但门槛和协作成本是硬伤。
AI 以效率插件形态嵌入既有软件,减少重复劳动,但仍是"辅助"而非"创作"。
Stable Diffusion 的开源催生了 LoRA、ControlNet、ComfyUI 等完整生态,证明了"强开源底座 = 生态底座"的公式。
分辨率提升、时长变长、运动稳定性改善。但大部分模型仍停留在"素材级"——生成一段画面后,还需回到剪辑软件做包装、字幕、调色、合成和音效。
H3 将画面生成、声音生成、文字呈现和镜头节奏整合在同一模型中,让用户无需依赖额外后期流程即可获得交付级片段。这不只是能力的叠加,而是生产范式的变化。
过去 AI 视频的价值是"能不能生成",现在行业真正关心的是"能不能交付"。H3 要回答的,正是后一个问题。
如果说 H3 的"交付级"能力是它的本分,那么 开源 才是它试图撬动行业格局的杠杆。视频生成领域,头部模型开源权重,这是第一次。
造成这一现象的原因不难理解:视频模型的训练成本、推理成本、数据组织和工程复杂度远高于文本与图像模型——越接近旗舰能力,厂商越倾向于用闭源 API 回收成本。此前的开源视频模型(万相、混元视频、LTX)与 Seedance 等闭源旗舰之间,行业普遍认为存在能力差距。H3 的出现,第一次弥合了这道鸿沟。
广告、影视、游戏、电商行业的视频生产涉及未公开产品、品牌资产、商业脚本。上传到第三方闭源模型意味着 数据外流与知识产权风险。H3 开源后,企业可私有化部署,将模型放在自己的服务器或私有云中运行,数据不出域,安全可控。
视频生产并非标准化场景。电商关注商品准确性,游戏关注角色一致性,短剧关注人物连续性。开源后,企业和开发者可以基于 H3 微调、适配和二次开发,训练更懂特定场景的行业版本,也可将其嵌入剪辑工具和创作平台,形成一体化工作流。
图像生成领域已经证明:强开源底座 = 插件生态 + 微调模型 + 工作流模板 + 行业应用。若视频领域也出现类似底座,围绕 H3 的推理优化、风格模型、行业插件和创作工具链可能随之形成。视频模型的竞争,正在从 闭源旗舰之间的单点能力比拼,进入 开放生态与产业落地能力的综合竞争。
注:开源时间与具体许可协议以 MiniMax 官方公告为准。企业部署需自行评估硬件与运维成本。
视频生成行业正在经历从"能不能生成"到"能不能交付"的范式转换。H3 以开源姿态将旗舰能力交到产业手中,真正改变游戏规则的,不是单点能力的领先,而是生态开放带来的产业渗透速度。
H3 即将开源,模型权重与评测流程将面向开发者开放。关注 MiniMax 官方渠道获取最新发布信息。
minimax.io → 关注开源