🎬 视频模型 · Agent 双发布
MiniMax H3 登顶全球视频编辑榜,4 天后 Agent 产品接棒——视频界迎来自己的 Claude Code 了?
7 月 31 日,MiniMax 发布视频模型 H3,最高 2K 分辨率,画面、运动、声音同框生成。截至 8 月中旬,它在 Artificial Analysis 视频编辑榜位列第一,文生视频、图生视频双双进入全球前三。4 天后,MiniMax 将产品升级为MiniMax Design——一个以 Agent 为入口的视频工作台。左手 SOTA 模型,右手深度耦合的 Agent,野心已经藏不住了。
来源:公开报道•
2026-08•
全文约 4 分钟读完
#MiniMax
#H3
#MiniMax Design
#视频生成
#AI Agent
🥇 第 1 名
视频编辑榜 · 文生/图生双双全球前三
0.8元/秒
定价仅为同级别产品的三分之一
330亿
H3-Base 视频生成模块参数量
⚡ 30 秒速览
- 成绩单:H3 登顶 Artificial Analysis 视频编辑榜,文生/图生视频双双进入全球前三,最高支持 2K 分辨率。
- 定价策略:发布即「加量不加价」,0.8 元/秒,同级别 1/3——一杯奶茶钱,跑完一轮素材 A/B/C 测试。
- 架构创新:三段式设计——Context-IR 负责语义理解、330 亿参数 H3-Base 负责生成、Regenerate-2K 负责高清重生成。
- 关键动作:发布 4 天后,MiniMax Hub 升级为 MiniMax Design,自我定位「Your localized multimodal AI Agent team」。
- 参照系:编程 Agent 已验证商业模型——Claude Code 不到一年 ARR 达 25 亿美元,贡献 Anthropic 总营收近 1/10。
- 现在就能用:H3 已接入 CapCut 等生态;MiniMax Design 小范围内测中。
01一次「三榜领先」的发布 排名之外,价格更狠
🥇 视频编辑榜 第 1 名MiniMax H3
第 1 名
文生视频榜 全球前三MiniMax H3
第 2–3 名
图生视频榜 全球前三MiniMax H3
第 2–3 名
注:柱长仅对应榜单名次(第 1 / 第 2–3),并非模型绝对得分;数据来自 Artificial Analysis 截至 2026 年 8 月中旬的公开榜单。
比排名更值得注意的,是定价。H3 发布即「加量不加价」:每秒 8 毛,仅为同级别产品的三分之一。
一杯奶茶钱,就能跑完一轮视频素材的 A/B/C 测试。
外部验证来得很快。字节剪映海外版 CapCut 在 H3 发布后第一时间接入上线,还专门发了一条官方宣布——对家生态主动接入,是最直接的背书。
但模型越强、成本越低,一个矛盾反而被放大了。
老板们想一周发它个七八十条视频,可写一条提示词仍要老师傅非遗式古法手敲几千字;保证片段间风格一致,也依然要手动抽卡、赛博祈愿。真正费时费力的部分,效率原地踏步。
于是,MiniMax 决定把效率补上。
02三段式架构:把黑盒变成导播台
大多数视频生成模型是一个黑盒:Prompt 进去、视频出来,中间如何理解、如何生成,用户几乎无法干预。「抽卡」,也因此成为 AI 视频相当长一段时间里的关键词。
H3 的不同,在于把黑盒拆成了三段,每一段都可以被理解、被介入:
H3-Context-IR语义理解 · 任务编排
→
H3-Base330 亿参数 · 视频生成
→
H3-Regenerate-2K2K 高清重生成
其中负责生成的是 H3-Base,但真正拉开体验差异的,是独立的 Context-IR 模块。
🎛️ 它像一个导播台
一次上传 9 张图 + 3 段视频 + 3 段音频作为上下文,Context-IR 负责理解这些多模态输入之间的关系,把「用户到底想干什么」翻译成模型可执行的结构化指令。
于是,视频小白完全不懂什么叫伦勃朗光、正反打、希区柯克变焦,也能上传一段参考音视频,让模型理解老板想要的「五彩斑斓的黑」到底是什么效果。
🧪 一个编辑实测
在 H3 已生成「奶牛猫 + 环尾狐猴打魁地奇」的动画片段后,把它把画面中的奶牛猫换成奶牛,并生成一段米高梅风格、带字体特效的狐猴怒吼片头。
结果:H3 读懂了「其他元素不变」的潜台词,还让片头与正片里的狐猴保持视觉一致——这就是局部编辑能力,也是它拿下「视频编辑榜」第一的直接原因。
但模型只是左腿。4 天后,右腿来了。
03MiniMax Design:以 Agent 为入口,而非生成器
8 月 3 日,MiniMax Hub 更名 MiniMax Design,首页留下一句话:「Your localized multimodal AI Agent team」。它没有把自己描述成「AI 视频生成器」——整个产品的入口是 Agent,任务拆解和执行也是 Agent,用户不需要在提示词和创作技巧上过多费心。
🎬 一句话,生成一条完整视频 实测案例
- 输入「奶牛猫带着环尾狐猴穿越到魔法世界,与一群巫师打魁地奇」,挂载 Documentary Skill。
- Skill 先询问期望的视频时长、清晰度与比例,随后把这一句话扩充为 700 多字的专业提示词。
- 几分钟后,成片完成。
从一句话到一条成片,创作门槛被压到「说人话」级别。
🖼️ 一个网站概念,一套完整视觉方案 创作者案例
- 只提供一个网站概念与几张页面参考。
- Design 自动拆解需求,生成动态网页展示、UI 动效与完整视觉方案。
- 还有人上传角色设定图,让 AI 直接制作角色展示 PV——动作、镜头、特效全包。
展示这些作品的博主大多不是专业 AI 视频创作者,播放量却达到数万甚至十几万。
🎥 3D 导演台:专业向的杀手锏 专业工具
- 上传参考照与参考视频,在导演台摆放角色素体、调度机位与姿态,快速搭建分镜参考。
- 分镜成为模型上下文的一部分,大幅提升抽卡成功率。
- 自动剪辑、自动添加字幕,一句命令精准执行。
目标很直接:降低专业制作的试错成本——这正是批量生产最痛的点。
整个系统跑在一条多 Agent 流水线上:主 Agent 判断创作意图、拆解任务、匹配模型并分发;后台并行工作——文案 Agent 写脚本、图像 Agent 出分镜、视频 Agent 调用 H3 生成画面。结果汇总到画布后,用户还能继续调整、编排、组合。
但一个诚实的追问是:视频 Agent 的商业价值,真的撑得起这份野心吗?
04参照系:编程 Agent 已经把路跑通了
要理解视频 Agent 的价值,最好的参照系是过去两年跑出 AI 应用层最疯狂增长曲线的编程 Agent。
7×Cursor 估值增速(成立 4 年)
8×Cursor ARR 增速(2026 年仍在持续)
$25亿Claude Code 年化收入,不到一年达成
近 1/10Claude Code 占 Anthropic 总营收
注:Claude Code 于 2025 年 5 月公开,至 2026 年 2 月 ARR 达 25 亿美元,成为 Anthropic 增长最快的业务板块。
两个案例指向同一个结论:能帮助用户完成完整任务的 Agent,是模型与商业化营收的超级入口。而相比之下,视频 Agent 的价值可能更大,壁垒也更强——差异体现在三个维度:
编程 Agent
反馈闭环:代码对不对,编译器给出无歧义的答案,Agent 可自动迭代修复。
资产状态:项目资产是文本文件,版本管理、局部修改、上下文复用成熟。
修改成本:改错一行,回滚一个 commit 就解决。
视频 Agent
反馈闭环:画面、节奏、表情都是审美判断,没有绝对标准,需更强意图理解。
资产状态:海量片段素材与角色资产,时序一致性至今是行业难题。
修改成本:一处不满意,可能整条重新生成——几十秒 GPU 算力 + 不可控的新结果。
核心矛盾因此浮出水面:视频越长,修改需求越多,重新生成的成本越高。所以代码 Agent 可以「先生成、再测试、失败重来」,视频 Agent 必须做到「先可控、再局部编辑」——这既要求模型本身具备多模态上下文理解,也要求工作台把「保留、修改、重生成」做得足够顺滑。
对批量生产来说,这才是真正的效率杠杆。
05为什么是 MiniMax 做出来了?
「Your localized multimodal AI Agent team.」
—— MiniMax Design 首页的产品自述
这句话定义了全部重心:入口是 Agent,不是生成器。MiniMax 的差异化,在于把模型与产品深度耦合——团队基于 H3 的特点构建了大量针对性 Skill:用户提供模糊输入后,Skill 更清楚如何把它改写成适配 H3 的提示词;图片、视频、音频哪些作为参考、哪些需要保留、增强或修改,全部被安排得明明白白。
🧩 深度耦合的 Skill提示词、参考素材、生成参数均针对 H3 专门调优,竞品难以复刻。
🎛️ 全局可控的上下文9 图 + 3 视频 + 3 音频同时作为参考,局部修改不丢一致性。
🧭 Agent 优先的入口拆任务、匹配模型、并行执行——用户只描述目标,不碰参数。
这套「模型 + 工作台」的耦合,正在释放一个更实际的商业信号:批量生产。对买量素材、电商短视频、教育科普动画来说,生成、调整、剪辑、导出都在一个工作台内完成,工作流带来的效率提升,远大于单个镜头的画质优化。
也正因如此,MiniMax H3 + MiniMax Design 距离成为视频领域的 Claude Code 式产品,或许真的只有一步之遥。
编辑核心判断
编程 Agent 用不到一年证明了「完整任务交付」是超级入口;视频 Agent 的反馈闭环更复杂、资产更难管理、修改成本更高——这些「更难」,恰恰是后来者的壁垒。MiniMax 把模型、Skill 与工作台焊成一体,赌的就是内容生产的批量流水线。诚实的注脚是:H3 的领先位次需要持续加固,Design 也仍在内测。真正的分水岭在于,局部编辑的顺滑度,能否支撑起一周几十条视频的规模化交付——撑住了,视频 Agent 就是下一个 Claude Code。
▶现在就能用
MiniMax Design 已启动小范围内测,H3 已上线 MiniMax 开放平台,并接入 CapCut 等生态。
小白路径:进入 MiniMax Design → 描述目标(如「生成一条纪录片风格视频」)→ 挂载对应 Skill → 交给 Agent 拆解执行。
专业路径:从 3D 导演台起步,上传参考照 + 参考视频,先搭分镜,再让 Agent 批量出片。
入口:MiniMax Design (小范围内测中)
H3 生成能力亦可在 CapCut 内直接调用,无需等待内测。