🏆 视频模型 · 突破

MiniMax H3 开源视频模型发布:手绘即特效,视频后期进入「Coding时刻」

7月31日,MiniMax 正式发布新一代视频模型 H3——首个开源视频模型,在 Artificial Analysis 榜单上斩获视频编辑第一。默认 2K 清晰度,支持手绘特效、文字生成、全模态输入,价格仅为主流模型的 1/3

综合公开信息整理 2026-07-31 全文约 4 分钟读完
#MiniMax H3 #开源视频模型 #手绘特效 #视频生成 #Artificial Analysis
🥇 视频编辑第一 Artificial Analysis 榜单 · 唯一开源
2K 默认输出分辨率
< 1/3 2K 每秒价格 vs 主流模型

⚡ 30 秒速览

  • 登顶榜单:Artificial Analysis 视频编辑榜第一,唯一开放权重的 SOTA 模型。
  • 范式颠覆:从「提供一段素材」变为「端到端交付成品」——剪辑、字幕、特效、配乐全部集成在模型里。
  • 三大核心能力:手绘即特效、视频内文字生成(每帧一致)、全模态输入(文字/图片/音频/视频)。
  • 价格屠夫:2K 分辨率每秒价格不到主流模型 1/3,768P 不到 1/2。
  • 完全开源:可私有部署,围绕 IP 与品牌风格深度微调。

01视频编辑榜第一 Artificial Analysis · 唯一开源 SOTA

🥇 MiniMax H3MiniMax · 开源
SOTA
SeedanceRunway
VideoPoet v2Google
Gen-4 AlphaRunway
Kling 2.0快手

注:榜单柱形为示意对比,精确排名以 Artificial Analysis 官方为准。H3 是前五名中唯一开放权重的模型,也是首个开源视频模型登上该榜第一。

02从「素材」到「成品」视频模型的一次范式跃迁

过去一年,视频模型因 Scaling 红利获得突飞猛进,但有一项定位未曾变化:它们只负责为你提供「一段素材」

素材生成后,你还得拖进 PR 里加字幕、调色、做转场、配音乐、套模板……后面还有「一万件」事在等着你。

但 H3 彻底打破了这个范式。

传统视频模型

只生成原始素材 → 用户自行剪辑、加字幕、调色、配乐 → 多人协作,流程冗长。

MiniMax H3

输入一段文本 → 模型直接输出可发布的成品:剪辑、字幕、转场、特效、BGM 全部端到端集成。

一个诚实的注脚:

文字生成尚未 100% 完美,但已进入商用门槛。精准编辑仍有提升空间——然而,从「玩具」到「工具」的跨越,已经完成

03三大核心能力 手绘、文字、全模态

✨ 最具冲击力

手绘即特效

花体字、字幕动画、视觉特效全部端到端生成,无需任何后期软件。输入一句描述,特效直接「长」在画面上。

📝 最接近商用

视频内文字生成

每帧文字一致,不崩坏。能理解文字与画面的关系——光影、景深、动态跟随,而非简单叠加。可做歌词 VJ、品牌物料。

🧠 最底层

全模态输入

文字、图片、音频、视频——所有素材都是模型理解上下文的一部分。传一张参考图胜过写三百字描述。

注:三大能力排序按用户感知冲击力与商业化潜力综合评估。「全模态输入」是底层能力,支撑前两者的实现。

04它到底能做什么?三个实测场景

🎬 男团出道花絮:AGI Boys 指令理解

  • 一句话 prompt,生成 Sam Altman、Dario Amodei、马斯克三人「AGI Boys」男团花絮视频。
  • 模型对用户意图嗅觉灵敏——仅用文本,就能理解想要的视觉风格和剪辑节奏。
  • 苹果发布会风格 prompt 直出平行宇宙中的「苹果版 MiniMax」,玻璃特效与渐变质感准确呈现。
结论:意图理解能力突出,风格化输出稳定。

🎥 六分镜预告片:AGI 复仇者联盟 指令遵循

  • 长 prompt 描述 6 个分镜,每个分镜指定不同情绪方向、表演逻辑与快节奏切换。
  • 所有分镜 完美遵守,蒙太奇段落(Dario 崩溃捶桌)情绪感染力强。
  • 模型对节奏、情绪、镜头逻辑的综合把控,已接近人工剪辑水平。
结论:长指令遵循能力出色,多分镜连贯性行业领先。

💎 钻石项链 VJ:文字+画面的融合 文字生成

  • 模型为文字「镶上钻」,带有光影变化与景深过渡,而非简单叠字。
  • 纯歌词 VJ 实测达到「能满足绝大部分卧室音乐人」的商用水平。
  • 文字与画面之间建立了语义理解——这是离商业化最近的能力。
结论:视频内文字生成进入商用门槛,可接广告与品牌物料。

05为什么能做到?全模态 + 语言涌现

H3 的一切能力,可以归因到同一个第一性原理:多模态 + 语言的涌现

图像、视频、音频这些自然模态紧密交织,承载海量信息。而语言,正是连接这些多模态孤岛最好的桥梁。

全模态输入上下文 CaptionH3-Omni Transformer端到端输出

具体来说,团队做了三件事:

4模态输入
2K默认分辨率
< 1/3价格 vs 主流
开源可部署

注:上下文 Caption 技术大幅拓宽了传统 Caption 的含义——不再只描述目标视频,而是同时刻画上下文与目标视频的关系,甚至理清上下文内部各元素之间的关联。

MiniMax 自创立之初便坚定布局多模态产品矩阵。H3 的发布,是此前多模态技术沉淀的集大成,也是团队基因和传统的又一次延续。

06敬开源 一张能与科技巨头坐上谈判桌的筹码

H3 这样一款 SOTA 级的视频模型,选择了开源。

这对有内容需求的企业来说,意义不言而喻。如果仅依赖云端 API,谁也不敢轻易将资产上传至第三方服务器。但一个可私有部署的模型,意味着能够毫无顾忌地用自有数据进行微调,围绕核心 IP、品牌画风与专属内容工作流进行深度定制。

技术与成本的门槛双双降低,H3 的开源,极有可能带来一场 IP 生命力的全面爆发。

Intelligence with Everyone —— 让智能与每个人同在。 MiniMax 公司愿景

从文本模型 M2 系列开始,MiniMax 每一代模型都在拓展开源的边界。如今 H3 将这条路铺进了视频生成的深水区。

回看这个 7 月:如果说 Kimi K3 扛起了 Coding 的开源大旗,那么 MiniMax H3 则在视频模型的赛道上,毅然立起了另一面旗帜。

中国开源的声音,这不是第一次响起。

也绝不会是最后一次。

编辑核心判断

视频生成正式进入「Coding时刻」——从「提供素材」到「交付成品」,范式已被改写。

文字生成尚未 100% 完美,精准编辑仍有提升空间。但开源 + 低价 + 全模态的组合,已让 H3 成为第一个真正面向真实场景交付的开源视频模型。中国开源,再次立起一面旗帜。

现在就能用

H3 已全面开放体验,登录官网即可生成你的第一个「手绘即特效」视频。

hailuoai.com → 开始创作