通用视频模型 MiniMax H3 正式开源,登顶 Hugging Face 社区第一
7 月,MiniMax 正式开源新一代通用视频模型 MiniMax H3,在 Artificial Analysis 视频编辑评测榜、Arena 图生视频排行榜中均位列全球第一,Hugging Face 热度超越 DeepSeek V4 Flash 升至榜首,成为开源社区最受关注的视频生成模型。
7 月,MiniMax 正式开源新一代通用视频模型 MiniMax H3,在 Artificial Analysis 视频编辑评测榜、Arena 图生视频排行榜中均位列全球第一,Hugging Face 热度超越 DeepSeek V4 Flash 升至榜首,成为开源社区最受关注的视频生成模型。
注:热度排名基于 Hugging Face 社区综合指标(点赞、下载、讨论)。柱形为示意比例,非精确数值。MiniMax H3 上线后迅速超越此前榜首 DeepSeek V4 Flash。
不止是社区热度。在更专业的评测维度上,MiniMax H3 同时拿下 Artificial Analysis 视频编辑评测榜和 Arena 图生视频排行榜的双料第一。这两个榜单分别考察模型在视频编辑任务中的精细控制能力,以及从静态图像生成视频的连贯性与创意表现。
MiniMax H3 不是单纯的"视频生成模型",而是一个统一的多模态理解与生成引擎。它能够同时处理文本、图像、视频、音频四种模态,并在它们之间自由转换。
这意味着什么?
通常只能"文本→视频",对图像、音频、已有视频的理解能力有限,多模态交互需要额外拼接。
统一理解四种模态,支持文本→视频、图像→视频、视频编辑、音频同步生成,端到端原生融合。
四项核心能力:多模态统一理解、2K 分辨率输出、最长 15 秒视频、带原生立体声音频,无需后期合成。
一个关键的技术细节:原生立体声音频。大多数视频生成模型需要额外调用音频模型来配声,而 MiniMax H3 在生成视频画面的同时同步生成音频,音画对齐更自然,延时更低。
MiniMax H3 的开源不是"发布即弃养"。模型权重、推理代码、示例脚本全部公开,社区可以本地部署、二次开发、甚至基于 H3 进行微调。
开源社区的热度迅速攀升至 Hugging Face 第一,背后是开发者对"可用开源视频模型"的强烈渴求。在此之前,高质量视频生成模型几乎被闭源产品垄断。
一个值得注意的对比:DeepSeek V4 Flash 此前在 Hugging Face 社区热度长期领先,而 MiniMax H3 凭借视频生成这一差异化能力实现了超越。这反映出社区对"多模态 + 视频"方向的强烈兴趣。
MiniMax 是国内最早一批押注多模态大模型的创业公司之一。从早期的文本模型到后来的语音、视频方向,公司一直保持对"多模态统一"的持续投入。
H3 的登顶,不是偶然的爆发,而是长期技术路线的兑现。2025 年至今,MiniMax 在视频生成领域积累了多个版本,H3 是其在统一架构、训练效率、生成质量三个维度同时达到临界点的产物。
一个诚实的注脚:
视频生成赛道竞争极其激烈。OpenAI 的 Sora、Google 的 Veo、以及国内多家公司的视频模型都在快速迭代。MiniMax H3 的开源策略,在时间窗口上占据了"先发开源"的红利——当大多数高质量视频模型仍然闭源时,谁能率先开放,谁就能获得社区生态的早期绑定。
视频生成正在经历 2024 年语言模型经历的开源时刻——"闭源演示"到"开源可用"的拐点已经到来。MiniMax H3 第一个站到了这个位置上,但真正的竞争才刚刚开始。
模型权重与推理代码已通过 Hugging Face 全面开源,开发者可本地部署体验。
Hugging Face → MiniMax 官方