🏆 开源 · 模型突破

通用视频模型 MiniMax H3 正式开源,登顶 Hugging Face 社区第一

7 月,MiniMax 正式开源新一代通用视频模型 MiniMax H3,在 Artificial Analysis 视频编辑评测榜、Arena 图生视频排行榜中均位列全球第一,Hugging Face 热度超越 DeepSeek V4 Flash 升至榜首,成为开源社区最受关注的视频生成模型。

综合公开信息整理 2026-07-23 全文约 3 分钟读完
#MiniMax #视频生成模型 #H3 #开源 #多模态
🥇 第 1 名 Hugging Face 开源社区热度
2K 最高生成分辨率
15 最长视频时长 · 原生立体声

⚡ 30 秒速览

  • 登顶双榜:Artificial Analysis 视频编辑评测榜、Arena 图生视频排行榜均列全球第一,Hugging Face 热度超越 DeepSeek V4 Flash。
  • 多模态统一:模型可同时理解文本、图像、视频、音频四种模态,并生成带原生立体声音频的视频内容。
  • 生成能力:最高 2K 分辨率、最长 15 秒视频,支持文本到视频、图像到视频、视频编辑等多种任务。
  • 开源生态:模型权重与推理代码已全面公开,开发者可本地部署或二次开发,社区反响热烈。
  • 战略意义:视频生成赛道从"闭源演示"进入"开源可用"阶段,MiniMax 成为该领域最重要的开源贡献者之一。

01开源社区热度登顶 Hugging Face 榜首

🥇 MiniMax H3MiniMax
🔥 1st
DeepSeek V4 FlashDeepSeek
2nd
Qwen3.8阿里
3rd
Llama 4Meta
4th
Mistral Large 3Mistral
5th

注:热度排名基于 Hugging Face 社区综合指标(点赞、下载、讨论)。柱形为示意比例,非精确数值。MiniMax H3 上线后迅速超越此前榜首 DeepSeek V4 Flash。

不止是社区热度。在更专业的评测维度上,MiniMax H3 同时拿下 Artificial Analysis 视频编辑评测榜Arena 图生视频排行榜的双料第一。这两个榜单分别考察模型在视频编辑任务中的精细控制能力,以及从静态图像生成视频的连贯性与创意表现。

02它为什么能登顶?多模态统一架构

MiniMax H3 不是单纯的"视频生成模型",而是一个统一的多模态理解与生成引擎。它能够同时处理文本、图像、视频、音频四种模态,并在它们之间自由转换。

这意味着什么?

传统视频模型

通常只能"文本→视频",对图像、音频、已有视频的理解能力有限,多模态交互需要额外拼接。

MiniMax H3

统一理解四种模态,支持文本→视频、图像→视频、视频编辑、音频同步生成,端到端原生融合。

4统一模态
2K最高分辨率
15s最长时长
原生立体声

四项核心能力:多模态统一理解、2K 分辨率输出、最长 15 秒视频、带原生立体声音频,无需后期合成。

一个关键的技术细节:原生立体声音频。大多数视频生成模型需要额外调用音频模型来配声,而 MiniMax H3 在生成视频画面的同时同步生成音频,音画对齐更自然,延时更低。

03它能做什么?三个典型场景

📝 文本直接生成完整视频 多模态融合

  • 输入一段描述文案,模型自主生成匹配画面、动作序列与背景音效。
  • 支持风格控制:写实、动画、胶片质感等,无需额外 prompt 工程。
  • 输出带原生立体声音频,可直接用于短视频、广告素材等场景。
关键能力:文本到视频的端到端生成,音画同步,无需后期配音。

🖼️ 静态图像 → 动态视频 图生视频 No.1

  • 上传一张图片,模型自动理解为动态场景,生成合理的运动轨迹与转场。
  • 在 Arena 图生视频排行榜中位列全球第一,评测维度包括动作合理性、一致性、创意性。
  • 支持输入多张参考图,实现角色一致性动画生成。
榜单表现:Arena 图生视频排行榜全球第一,综合评分领先。

🎬 视频编辑与延展 视频编辑评测榜首

  • 对已有视频进行局部修改、风格转换、时长延展,保持画面一致性。
  • 在 Artificial Analysis 视频编辑评测榜中位列第一,精细控制能力突出。
  • 支持按时间轴分段编辑,修改某一段内容而不影响其他部分。
评测维度:编辑精度、一致性、效率三项均领先,综合评分第一。

04开源社区:不只是发布代码

MiniMax H3 的开源不是"发布即弃养"。模型权重、推理代码、示例脚本全部公开,社区可以本地部署、二次开发、甚至基于 H3 进行微调。

开源社区的热度迅速攀升至 Hugging Face 第一,背后是开发者对"可用开源视频模型"的强烈渴求。在此之前,高质量视频生成模型几乎被闭源产品垄断。

模型权重 推理代码 示例脚本 本地部署 二次开发 微调支持 社区讨论

一个值得注意的对比:DeepSeek V4 Flash 此前在 Hugging Face 社区热度长期领先,而 MiniMax H3 凭借视频生成这一差异化能力实现了超越。这反映出社区对"多模态 + 视频"方向的强烈兴趣。

🔓 开源可用:模型已全面公开,开发者可通过 Hugging Face 下载权重与代码,支持本地部署与商业应用(需遵守开源协议)。

05为什么是 MiniMax 做出来了?

MiniMax 是国内最早一批押注多模态大模型的创业公司之一。从早期的文本模型到后来的语音、视频方向,公司一直保持对"多模态统一"的持续投入。

H3 的登顶,不是偶然的爆发,而是长期技术路线的兑现。2025 年至今,MiniMax 在视频生成领域积累了多个版本,H3 是其在统一架构、训练效率、生成质量三个维度同时达到临界点的产物。

一个诚实的注脚:

视频生成赛道竞争极其激烈。OpenAI 的 Sora、Google 的 Veo、以及国内多家公司的视频模型都在快速迭代。MiniMax H3 的开源策略,在时间窗口上占据了"先发开源"的红利——当大多数高质量视频模型仍然闭源时,谁能率先开放,谁就能获得社区生态的早期绑定。

编辑核心判断

视频生成正在经历 2024 年语言模型经历的开源时刻——"闭源演示"到"开源可用"的拐点已经到来。MiniMax H3 第一个站到了这个位置上,但真正的竞争才刚刚开始。

现在就能用

模型权重与推理代码已通过 Hugging Face 全面开源,开发者可本地部署体验。

Hugging Face → MiniMax 官方