视频模型新范式:MiniMax H3 手绘即特效,端到端颠覆后期剪辑
7 月 31 日,MiniMax 正式发布 H3——首个开源 SOTA 视频模型。手绘特效、动态文字、音频驱动口型、全模态输入……过去需要 PR 里数小时完成的后期工作,现在一段文本直出成片。海外社区已公认其为全新视频编辑标杆。
7 月 31 日,MiniMax 正式发布 H3——首个开源 SOTA 视频模型。手绘特效、动态文字、音频驱动口型、全模态输入……过去需要 PR 里数小时完成的后期工作,现在一段文本直出成片。海外社区已公认其为全新视频编辑标杆。
注:Artificial Analysis 榜单综合视频编辑质量、指令遵循、文字渲染、多模态对齐等维度。柱形为相对分数示意,精确排名以官方榜单为准。H3 是唯一开源且权重开放的榜首模型。
过去一年,视频模型只负责提供「一段素材」——生成后你还得拖进 PR 里加字幕、调色、做转场、配音乐。H3 彻底打破了这个范式。它将剪辑逻辑、字体排版、转场设计、节奏把控、背景音乐以及视觉特效,全部端到端集成到模型之中。
生成素材 → 导入剪辑软件 → 手动加字幕、转场、特效、调色、配乐 → 导出成片。
输入文本 → 直出成片,手绘特效、动态文字、多分镜叙事、音频驱动口型全部内置,零后期。
手绘特效:在视频中直接「画」出花体字、动态图形、光效——不是贴上去的,而是模型原生渲染,与画面光影、景深融为一体。
文字不崩坏:AI 视频的文字一直是最难啃的骨头——每一帧都要保持形态一致。H3 做到了每一帧文字稳定,且能理解文字与画面的关系,自动为文字添加光影、景深、材质效果,而非简单叠字。
实测:钻石项链 VJ 中,文字随光线变化产生折射效果;歌词 VJ 中,文字与节奏同步跳动,达到可商用水平。
丢一段音频进去,H3 就能让角色「说出台词」——不是生硬的 TTS 念稿,声音跟着画面情绪和节奏一起走。这是 MiniMax 在多模态语音模型上的积累,在同一个模型里打通了语音与视频能力。
H3 的能力,根植于一个第一性原理:多模态 + 语言的涌现。
图像、视频、音频——这些自然模态紧密交织,是人与世界交互的基本媒介,承载了海量信息。而语言,正是连接这些多模态孤岛最好的桥梁。H3 支持全模态输入:文字、图片、音频、视频……所有素材都是模型理解上下文的一部分。「能用图就不用字,能用视频就不用图」——信息密度远超纯文本。
团队搭建了 H3-Omni Transformer 原生架构,主打多模态场景下的通用 + 高效。同时专门定制了 Caption 模型——不再只是「描述目标视频」,而是刻画上下文与目标视频的关系,甚至理清上下文内部各元素之间的关联。语言在这里充当了可泛化的「胶水」,这是 H3 指令理解能力的根源。
一个诚实的注脚:
文字生成在视频中仍不是 100% 完美——极少数复杂场景下可能出现抖动。但 「能用」已经没问题,且迭代速度极快。对于品牌物料、歌词 VJ、动态标题等场景,H3 已经达到可商用水平。
答案藏在公司基因里。MiniMax 自创立之初,便坚定布局多模态产品矩阵——从语音模型到视频模型,多模态能力一直是这家公司最鲜明的标签。
H3 的发布,是此前多模态技术沉淀的集大成。语音能力与视频能力在同一个模型里打通,全模态输入的积累让模型对用户意图的理解远超同行。
更深层的原因:MiniMax 在开源路线上已经坚守了很久。从文本模型 M2 系列开始,每一代都在拓展开源的边界。如今 H3 将这条开源之路铺进了视频生成的深水区——一个 SOTA 级视频模型,权重开放,可私有部署。
回看 2026 年 7 月:如果说 Kimi K3 扛起了 AI Coding 的开源大旗,那么 MiniMax H3 则在视频模型赛道上立起了另一面旗帜。视频生成,正式进入「Coding 时刻」——面向真实场景交付,而不仅仅是生成素材。
视频模型从「生成素材」到「交付成片」的范式跨越,比参数竞赛更值得关注。H3 证明:端到端集成后期能力,比单纯提升分辨率更能释放视频模型的商用价值。 而开源,让这场变革的参与门槛降到了历史最低。
模型权重已开源,在线体验已全面开放。登录官网即可直接生成,无需任何后期软件。
hailuoai.com → 立即体验