AI·快讯
🎬 视频模型 · 范式突破

视频模型新范式:MiniMax H3 手绘即特效,端到端颠覆后期剪辑

7 月 31 日,MiniMax 正式发布 H3——首个开源 SOTA 视频模型。手绘特效、动态文字、音频驱动口型、全模态输入……过去需要 PR 里数小时完成的后期工作,现在一段文本直出成片。海外社区已公认其为全新视频编辑标杆。

综合公开信息整理 2026-07-31 全文约 4 分钟读完
#MiniMax H3 #视频模型 #开源 SOTA #端到端生成 #手绘特效
🥇 第 1 名 Artificial Analysis 视频编辑榜单
2K 默认输出分辨率,无后期缩放
<⅓ 2K 下每秒价格不到主流模型 1/3

⚡ 30 秒速览

  • 赢了多少:Artificial Analysis 视频编辑榜单第一,社区公认全新 SOTA,唯一开放权重的榜首模型。
  • 核心能力:手绘特效、动态文字渲染、音频驱动口型、多分镜叙事——全部端到端,无需任何后期软件。
  • 全模态输入:文字、图片、音频、视频……所有素材都是模型理解上下文的一部分,信息密度远超纯文本
  • 开源可私有化:权重开放,可私有部署、微调,企业可围绕核心 IP 深度定制,数据不上云
  • 价格屠夫:2K 分辨率每秒不到主流模型 1/3,768P 不到 1/2,商用门槛大幅降低

01视频编辑榜单第一 Artificial Analysis 最新排名

🥇 MiniMax H3MiniMax · 开源
SOTA
Seedance 2.0Runway
VideoGen-4Google DeepMind
Kling 2.0Kuaishou
Sora TurboOpenAI

注:Artificial Analysis 榜单综合视频编辑质量、指令遵循、文字渲染、多模态对齐等维度。柱形为相对分数示意,精确排名以官方榜单为准。H3 是唯一开源且权重开放的榜首模型。

02手绘即特效,文字不崩坏 两个最炸裂的能力

过去一年,视频模型只负责提供「一段素材」——生成后你还得拖进 PR 里加字幕、调色、做转场、配音乐。H3 彻底打破了这个范式。它将剪辑逻辑、字体排版、转场设计、节奏把控、背景音乐以及视觉特效,全部端到端集成到模型之中。

两个维度,让海外开发者集体沸腾。

传统视频模型

生成素材 → 导入剪辑软件 → 手动加字幕、转场、特效、调色、配乐 → 导出成片。

MiniMax H3

输入文本 → 直出成片,手绘特效、动态文字、多分镜叙事、音频驱动口型全部内置,零后期。

手绘特效:在视频中直接「画」出花体字、动态图形、光效——不是贴上去的,而是模型原生渲染,与画面光影、景深融为一体。

文字不崩坏:AI 视频的文字一直是最难啃的骨头——每一帧都要保持形态一致。H3 做到了每一帧文字稳定,且能理解文字与画面的关系,自动为文字添加光影、景深、材质效果,而非简单叠字。

实测:钻石项链 VJ 中,文字随光线变化产生折射效果;歌词 VJ 中,文字与节奏同步跳动,达到可商用水平。

03它到底能做什么?三个实测案例

🎬 男团「AGI Boys」出道花絮 基础能力

  • 一句话 prompt:将 Sam Altman、Dario Amodei、马斯克三人素材混剪为男团出道花絮。
  • 模型自主理解「嚣张」「硅谷 AI 圈」等语义,输出风格统一的快节奏混剪,包含转场、字幕、背景音乐。
  • 对用户意图的嗅觉异常灵敏——只给文本,就能理解想要的视觉和剪辑风格
结论:基础叙事能力远超预期,风格迁移自然。

🎥 「AGI 复仇者联盟」六分镜预告片 长指令遵循

  • 长 prompt 测试:描述六个分镜,每个分镜指定不同情绪方向、表演逻辑、节奏要求。
  • H3 完美遵守每一个分镜指令,蒙太奇段落情绪连贯,Dario 崩溃捶桌镜头被评价「给我干 PTSD 了」。
  • 多分镜之间的叙事连贯性——过去模型最难做到的事,H3 一次性通过。
结论:长指令、多分镜场景下,指令遵循能力达到实用级别。

💎 超豪华钻石项链 VJ 文字+视觉融合

  • 文字不是简单叠加在画面上,而是镶嵌在画面中——有光影变化、有景深过渡。
  • 模型理解「奢华」「钻石」等语义,自动为文字赋予材质感和光效,与项链视觉风格统一。
  • 这是离商业化最近的能力——品牌物料、广告片、动态标题,H3 可以直接交付。
结论:文字与视觉的深度融合,打开了品牌营销的商用空间。
还有一个容易被忽略的能力:音频驱动口型

丢一段音频进去,H3 就能让角色「说出台词」——不是生硬的 TTS 念稿,声音跟着画面情绪和节奏一起走。这是 MiniMax 在多模态语音模型上的积累,在同一个模型里打通了语音与视频能力

04技术底座:多模态 + 语言的涌现

H3 的能力,根植于一个第一性原理:多模态 + 语言的涌现

图像、视频、音频——这些自然模态紧密交织,是人与世界交互的基本媒介,承载了海量信息。而语言,正是连接这些多模态孤岛最好的桥梁。H3 支持全模态输入:文字、图片、音频、视频……所有素材都是模型理解上下文的一部分。「能用图就不用字,能用视频就不用图」——信息密度远超纯文本。

全模态文字/图片/音频/视频
Omni原生多模态架构
定制 Caption全模态理解管线
开源权重开放可私有化

团队搭建了 H3-Omni Transformer 原生架构,主打多模态场景下的通用 + 高效。同时专门定制了 Caption 模型——不再只是「描述目标视频」,而是刻画上下文与目标视频的关系,甚至理清上下文内部各元素之间的关联。语言在这里充当了可泛化的「胶水」,这是 H3 指令理解能力的根源。

🔓 开源,且可私有部署:H3 权重已开放,企业可基于自有数据进行微调,围绕核心 IP、品牌画风与专属内容工作流进行深度定制。
hailuoai.com · 开源模型权重已发布

一个诚实的注脚:

文字生成在视频中仍不是 100% 完美——极少数复杂场景下可能出现抖动。但 「能用」已经没问题,且迭代速度极快。对于品牌物料、歌词 VJ、动态标题等场景,H3 已经达到可商用水平。

05为什么是 MiniMax 做出来了?

答案藏在公司基因里。MiniMax 自创立之初,便坚定布局多模态产品矩阵——从语音模型到视频模型,多模态能力一直是这家公司最鲜明的标签。

H3 的发布,是此前多模态技术沉淀的集大成。语音能力与视频能力在同一个模型里打通,全模态输入的积累让模型对用户意图的理解远超同行。

更深层的原因:MiniMax 在开源路线上已经坚守了很久。从文本模型 M2 系列开始,每一代都在拓展开源的边界。如今 H3 将这条开源之路铺进了视频生成的深水区——一个 SOTA 级视频模型,权重开放,可私有部署

多模态基因全模态理解Omni 架构开源 SOTA

回看 2026 年 7 月:如果说 Kimi K3 扛起了 AI Coding 的开源大旗,那么 MiniMax H3 则在视频模型赛道上立起了另一面旗帜。视频生成,正式进入「Coding 时刻」——面向真实场景交付,而不仅仅是生成素材。

编辑核心判断

视频模型从「生成素材」到「交付成片」的范式跨越,比参数竞赛更值得关注。H3 证明:端到端集成后期能力,比单纯提升分辨率更能释放视频模型的商用价值。 而开源,让这场变革的参与门槛降到了历史最低。

现在就能用

模型权重已开源,在线体验已全面开放。登录官网即可直接生成,无需任何后期软件。

hailuoai.com → 立即体验