AI·快讯
🎬 视频生成 · 开源

视频旗舰模型 H3 宣布开源,价格仅为竞品三分之一——视频生成行业变天了?

MiniMax 今日发布视频旗舰模型 H3,在效果获得创作者认可的同时,价格仅为 Seedance 2.0 的三分之一。更关键的是:即将开源。这是第一个做到这一水平的开源视频模型,可能改变整个行业的游戏规则。

综合公开信息整理 2026 年 1 月 全文约 4 分钟读完
#MiniMax #H3 #视频生成 #开源 #多模态
🥇 第 1 名 Artificial Analysis 视频编辑榜单
1130 Elo 评分,领先 Google 与字节跳动
1/3 价格,仅为 Seedance 2.0 的 1/3

⚡ 30 秒速览

  • 赢了多少:H3 在 Artificial Analysis 视频编辑榜单以 1130 Elo 登顶,领先 Google Gemini Omni、字节 Seedance 2.0 等模型。
  • 核心看点:价格仅为 Seedance 2.0 的 1/3,且是第一个达到旗舰水平的开源视频模型
  • 全模态统一:文本、图片、音频、视频纳入同一上下文,理解创作意图后一次性生成接近商业成片的内容。
  • 编辑能力:支持换人、换物、换背景、绿幕合成、改台词、调光影、视频续写等精确操作。
  • 开源意义:企业可私有化部署,解决数据安全顾虑;有望成为视频领域的开放底座,催生插件与行业模型生态。

01榜单成绩 视频编辑能力排名第一

在 Artificial Analysis 最新的视频编辑排行榜中,MiniMax H3 以 1130 Elo 排名第一,领先 Google Gemini Omni、字节 Seedance 2.0 等模型。榜单排名证明了 H3 的效果水平,但真正决定其商业价值的是它能否进入真实的商业应用场景。

🥇 MiniMax H3MiniMax
1130
Google Gemini OmniGoogle
1095
Seedance 2.0字节跳动
1078
Veo 2.0Google
1060
Kling 1.6快手
1042

注:柱形为相对比例示意,Elo 分差以标注数字为准。榜首与第二名分差 35 Elo,与第五名分差 88 Elo。榜单数据取自 Artificial Analysis 公开排行榜。

02价格与开源 三分之一的价格,全量开放

H3 的竞争力并不只体现在模型效果上,也体现在性价比上。对于需要高频生成和快速迭代的商业场景而言,其商业化吸引力有望进一步放大。

Seedance 2.0(闭源)

行业标杆级闭源视频模型,效果出色但价格高昂。

基准价

MiniMax H3(开源)

效果比肩 Seedance 2.0,且全量开放权重,可私有化部署。

1/3 仅为 Seedance 2.0 的价格

但价格只是冰山一角。H3 真正的差异化在于:它是第一个达到旗舰水平的开源视频模型。在视频生成领域,真正具备头部能力的模型开放权重,仍是少数事件。原因在于,视频模型的训练成本、推理成本、数据组织和工程复杂度都远高于文本与图像模型,越接近旗舰能力,模型厂商越倾向于用闭源产品和 API 回收成本。

H3 的特殊之处在于,它不仅效果比肩闭源旗舰,而且价格更低,还全量开源。这意味着开发者、企业、创作者都可以基于 H3 进行二次开发、微调与私有化部署。

03它能做什么?三个真实场景

H3 把文本、图片、音频、视频等素材纳入同一个上下文,由模型统一理解创作意图,并在此基础上完成从脚本理解、分镜生成、角色与场景保持、动作迁移、音画同步,到字幕、品牌文字、转场包装和局部编辑等一系列任务,最终一次性生成更接近商业成片的视频内容。

🎩 魔术师换装:全模态编辑 + 复杂文字保持 高成功率

  • Prompt:两位魔术师站在舞台上面向观众表演互换魔术——挥动魔杖、烟雾升起、西装颜色互换、手套颜色不变、鞠躬致谢、幕布从深红渐变深蓝。
  • H3 抽卡成功率非常高,在人物一致性、动作连贯性和色彩变换上表现稳定。
  • 对比 Seedance 2.0 在同一 prompt 下略逊一筹,尤其在颜色互换和幕布渐变上出现偏差。
关键能力:多主体一致性 + 精确颜色控制 + 复杂场景理解

✨ 实拍视频叠加手绘发光动画 AI 原生后期

  • 海外开发者 @hasantoxr 测试:H3 可以给实拍视频增加手绘发光动画,通过自然语言描述即可指挥动画路线。
  • 模型能匹配场景光线,同时保留真实光影关系,动画与实拍素材自然融合。
  • 过去这类工作通常属于 Adobe AE 和人工后期的领地,视频模型更多只是提供原始素材。
关键能力:后期包装前置 + 光影融合 + 自然语言驱动动画

🎬 一站式成片:画面 + 声音 + 文字 + 节奏同步生成 接近商业交付

  • H3 将画面生成、声音生成、文字呈现和镜头节奏整合在同一模型中,无需依赖额外后期处理。
  • 电影片头字幕、产品 UI 文字、动态海报排版等场景中,文字在连续帧中保持稳定,不变形不漂移。
  • 声音不再区分人声、音效和音乐,统一生成并与画面同步。
关键能力:多模态同步 + 文字稳定性 + 端到端交付

四项核心技术支撑

Contextual Omni Representation

增强多模态描述能力,理解素材之间、素材与目标视频之间,以及画面与声音之间的语义关系。

H3-VAE

升级视频 tokenizer,提升重建质量与压缩效率,带来 4 倍序列长度收益,支持原生 2K 输出。

H3-Omni Transformer

理解与生成异构训练架构,样本间负载均衡,端到端训练吞吐提升近 30%。

In-context Regeneration

基模基于低分辨率结果和上下文信息重新生成 2K 细节,提升小文字、纹理和画面细节的还原能力。

04H3 处在什么位置?视觉生产工具的演进拐点

要理解 H3 的位置,得先回顾视觉内容生产工具这些年的演进。过去十多年,视觉生产经历了从专业软件到 AI 辅助、从图像生成到视频生成的连续跃迁。H3 所处的节点,正是视频模型从素材生成走向商业级成片交付的关键阶段。

专业软件AI 辅助工具图像生成模型视频生成模型H3 商业级成片

过去线性的视频生产流程正在被 AI 模型压缩:从素材生成、剪辑包装到调色配音,越来越多原本需要后期完成的执行环节,开始被模型直接吸收进生成过程。创作者仍负责节奏、审美和商业判断,但单位内容的生产成本、交付周期和试错速度正在被改写。

H3 的设计明显是冲着真实生产场景去的——是冲着商业级成片交付去的。

H3 把一部分后期包装能力前置到模型内部,实现了 AI 原生后期。如果这些能力能够在真实工作流中稳定复现,那 H3 代表的将是一次新的突破:从生成素材,进一步走向理解内容、执行包装、完成编辑和接近交付。这也是 H3 在行业中的真正位置——它处在视频模型从文娱工具转向工业生产力工具的拐点上。

05开源意味着什么?从产品到基础设施

如果说 H3 的商业级成片交付能力是"本分",那么开源才是它真正试图撬动行业格局的地方:MiniMax 不仅是把一款视频旗舰模型推向市场,还把它交给开发者、企业和创作工具链共同改造。

一个诚实的注脚:

此前,视频生成的开源阵营中,阿里万相、腾讯混元视频、LTX 等模型较为活跃,但与 Seedance 这样的闭源旗舰相比,行业普遍认为仍存在能力差距。H3 的特殊之处在于,它是第一个效果比肩闭源旗舰的开源多模态模型

企业侧:获得部署、数据与工作流的控制权

对广告、影视、游戏、电商等行业而言,视频生产往往涉及未公开产品、品牌资产、商业脚本和内部创意方案。这些内容一旦上传到第三方闭源模型,就意味着企业要承担数据外流、知识产权归属不清和商业机密泄露的风险。H3 开源后,企业可以选择私有化部署,把模型放在自己的服务器或私有云中运行。

生态侧:视频领域的开放底座

视频生产本身并非标准化场景。电商关注商品准确性和转化效率,游戏关注角色一致性和动作风格,影视短剧关注人物连续性和情绪节奏。开源后,企业和开发者可以基于 H3 微调、适配和二次开发,训练更懂垂直场景的行业版本,也可以将其嵌入剪辑工具和创作平台。

图像生成领域已经证明,强开源底座往往会催生插件、微调模型、工作流模板和行业应用。若视频领域也出现类似底座,围绕 H3 的推理优化、风格模型、行业插件和创作工具链也可能随之形成。

🏭 企业私有化部署 🧩 LoRA 微调 🔧 ComfyUI 工作流 🎬 行业垂直模型 ☁️ 推理优化服务 📦 创作工具链集成

H3 开源释放了一个明确信号:视频生成的竞争,正在从闭源旗舰之间的单点能力比拼,进入开放生态和产业落地能力的综合竞争。

编辑核心判断

H3 开源标志着视频模型竞争从"谁画质更好"转向"谁能形成生态密度"——闭源旗舰的护城河正在被重新定义,下一个 Stable Diffusion 时刻可能正在视频领域上演。

开源与体验

H3 已正式发布,开源代码与模型权重即将公布。开发者可关注 MiniMax 官方渠道获取最新进展。

关注 MiniMax 官方 → 获取开源信息