🏭 硬科技 · 视频生成

全球首个千亿级 MoE 视频模型开源,Sand.ai 给视频生成 Scaling 找了条新路

MAGI-2 Preview 总参数约 114B,单次激活约 6B,以国产创企身份闯入 Artificial Analysis Image to Video 全球前十,位列第六,并全面开源。

综合公开信息整理 2026-08-04 全文约 4 分钟读完
#Sand.ai #MAGI-2 #MoE #视频生成 #开源
🏆 全球第六 Artificial Analysis 榜单前十唯一国产开源模型
114B 总参数量
6B 单次前向激活参数量
100% 全面开源

⚡ 30 秒速览

  • 赢了多少:全球首个千亿级 MoE 视频生成模型,总参数 114B,激活 6B,位列 Artificial Analysis 榜单第六。
  • 路线创新:独创“统一单流 + 细粒度 Multi-Head MoE”架构,音画从生成开始联合建模,而非后期拼接。
  • 系统自研:自研 MagiMoE 算子库与 MagiMuon 优化器,解决了千亿参数 MoE 训练与推理的通信与稳定性难题。
  • 数据策略:预训练强调完整覆盖数据分布,后训练专注对齐,反对过度清洗,为 Scaling 保留多样性。
  • 开源承诺:代码与权重全面开源,后续模型可沿此路线继续扩展,无需每次从头搭建训练系统。

01视频生成撞上“两堵墙” 容量与成本的双重瓶颈

2026 年前 5 个月,国内 AI 短剧市场规模突破 220 亿元,全年有望冲击 400 亿元,用户超 6 亿。需求端的爆发式增长,正在将基础模型的承载能力逼至极限。

但视频生成模型的进化,撞上了两堵墙。

一堵是容量墙

一段 1000 字英文短文约 1000 token。但一张 720P 图片被切分成近千个 patch tokens,一秒视频 24 帧。一段几秒的视频,序列长度轻松达到纯文本任务的 数百倍

一堵是成本墙

面对百万级 token,每一次前向计算都要处理远超文本的数据量。继续放大稠密模型,参数量同步增长,机器被拖慢,效果却未必提升。

大语言模型已经用 MoE 探索出一条 Scaling 路径。问题是:这条路能迁移到视频模型上吗?

Sand.ai 用 MAGI-2 Preview 给出了答案。

02模型层:统一单流,音画同出 从生成开始便共同建模

现有统一音视频模型常见两种路径:多流架构与级联方案。但 MAGI-2 Preview 选择了第三条路——单流架构

多流 / 级联方案

视频和音频进入不同网络分支,通过 cross-attention 或专用模块交换信息。架构复杂,端到端延迟高,音画关系需要经过多段链路才能建立。

MAGI-2 Preview 单流架构

文本、视频和音频被放进同一个上下文,在每一层 self-attention 中直接交互。架构更简单,延迟远低于多流方案,声音、口型、表情、动作从生成开始便被统一建模。

⚙️ 共享专家 + 专属专家 分工明确

  • 共享专家:处理三种模态的共性特征,如场景语义、运动趋势。
  • 专属专家:为文本、视频和音频保留各自分支,处理模态差异。
  • 结果:无需维护多套生成主干和额外的跨模态融合模块,端到端效率显著提升。

03架构层:把专家粒度做到极致 Multi-Head MoE 的降维打击

传统 MoE 为一个 token 的完整表示选择一组专家,相当于要求少数专家同时理解语义、动作、外观、声音等所有维度的特征。这限制了模型对不同信息类型的分化处理能力。

MAGI-2 Preview 采用了 Multi-Head MoE,将同一个 token 的 3072 维隐藏表示拆成 12 个 256 维的子空间,每个子空间独立路由、各自选择专家。

3072隐藏表示维度
12子空间数量
256每个子空间维度
36主体网络层数

注:每个子空间独立路由,相当于将路由粒度提升了 12 倍,让模型能更精细地组合不同特征维度的专家能力。

在通信层面,Head Parallel 将跨设备通信前置到路由之前,按 head 分发数据,主要通信量只取决于输入表示本身,而非专家数量。这让数千个专家在千亿参数规模下保持高效运转。

04系统层:让几千个专家别堵在路上 自研 MagiMoE 与 MagiMuon

Multi-Head MoE 解决了路由粒度问题,但数千个细粒度专家在训练中产生的频繁路由决策、数据重排和显存搬运,对底层算子和优化器提出了苛刻要求。

⚡ MagiMoE 算子库

覆盖路由、专家排序与专家计算的完整链路,将原本分散的步骤合并执行,减少中间结果与显存搬运。当前采用经过大规模训练验证的 Triton/BF16 路径。

🧠 MagiMuon 优化器

以 Muon 处理主体矩阵参数,以 AdamW 处理更适合常规更新的参数,并针对海量细粒度专家重新适配了参数组织与跨设备计算,让优化方法稳定扩展至千亿参数。

注:系统层的自研能力是模型层和架构层能够落地的关键,也是 Sand.ai 从众多视频生成创企中脱颖而出的核心壁垒。

05数据策略:预训练看世界,后训练谈对齐

Scaling Law 有一个经常被忽略的前提:参数量增大,数据的信息密度也需要同步提高

但提高信息密度不等于缩小数据集。过度清洗会让模型失去对复杂运动、特殊镜头、罕见主体和非典型声音的覆盖能力,最终参数规模的增长无法转化为真实场景中的生成能力。

Sand.ai 更强调数据的规模、多样性与分布覆盖。数据工作的重点从删减转向组织——通过更准确、细粒度的标注,让模型理解主体、动作、场景、镜头、时序以及音频与文本之间的对应关系。

📊 预训练 vs 后训练的分工定义

  • 预训练:负责尽可能完整地覆盖数据分布,保留广泛的有效数据。
  • 后训练:聚焦于偏好对齐、可控性与产品适配。
  • 结果:基础模型在预训练阶段学到的能力越完整,产品端依赖后处理去修补运动一致性、细节表现和组合能力的需求就越少。
编辑核心判断

MAGI-2 Preview 验证了一整条路线:统一单流负责音画联合建模,细粒度 MoE 负责扩大容量,自研系统负责让千亿参数稳定运转。视频生成的 Scaling Law,从此有了新写法。而全面开源,让这条路线成为行业基础设施,而非一家之言。

现在就能用

MAGI-2 Preview 已全面开源,模型权重与推理代码均可获取,开发者可基于此继续探索更长时长、更复杂场景的视频生成。

官方 GitHub 仓库 → 获取模型与代码