全球首个千亿级 MoE 视频模型开源,Sand.ai 给视频生成 Scaling 找了条新路
MAGI-2 Preview 总参数约 114B,单次激活约 6B,以国产创企身份闯入 Artificial Analysis Image to Video 全球前十,位列第六,并全面开源。
MAGI-2 Preview 总参数约 114B,单次激活约 6B,以国产创企身份闯入 Artificial Analysis Image to Video 全球前十,位列第六,并全面开源。
2026 年前 5 个月,国内 AI 短剧市场规模突破 220 亿元,全年有望冲击 400 亿元,用户超 6 亿。需求端的爆发式增长,正在将基础模型的承载能力逼至极限。
但视频生成模型的进化,撞上了两堵墙。
一段 1000 字英文短文约 1000 token。但一张 720P 图片被切分成近千个 patch tokens,一秒视频 24 帧。一段几秒的视频,序列长度轻松达到纯文本任务的 数百倍。
面对百万级 token,每一次前向计算都要处理远超文本的数据量。继续放大稠密模型,参数量同步增长,机器被拖慢,效果却未必提升。
大语言模型已经用 MoE 探索出一条 Scaling 路径。问题是:这条路能迁移到视频模型上吗?
Sand.ai 用 MAGI-2 Preview 给出了答案。
现有统一音视频模型常见两种路径:多流架构与级联方案。但 MAGI-2 Preview 选择了第三条路——单流架构。
视频和音频进入不同网络分支,通过 cross-attention 或专用模块交换信息。架构复杂,端到端延迟高,音画关系需要经过多段链路才能建立。
文本、视频和音频被放进同一个上下文,在每一层 self-attention 中直接交互。架构更简单,延迟远低于多流方案,声音、口型、表情、动作从生成开始便被统一建模。
传统 MoE 为一个 token 的完整表示选择一组专家,相当于要求少数专家同时理解语义、动作、外观、声音等所有维度的特征。这限制了模型对不同信息类型的分化处理能力。
MAGI-2 Preview 采用了 Multi-Head MoE,将同一个 token 的 3072 维隐藏表示拆成 12 个 256 维的子空间,每个子空间独立路由、各自选择专家。
注:每个子空间独立路由,相当于将路由粒度提升了 12 倍,让模型能更精细地组合不同特征维度的专家能力。
在通信层面,Head Parallel 将跨设备通信前置到路由之前,按 head 分发数据,主要通信量只取决于输入表示本身,而非专家数量。这让数千个专家在千亿参数规模下保持高效运转。
Multi-Head MoE 解决了路由粒度问题,但数千个细粒度专家在训练中产生的频繁路由决策、数据重排和显存搬运,对底层算子和优化器提出了苛刻要求。
覆盖路由、专家排序与专家计算的完整链路,将原本分散的步骤合并执行,减少中间结果与显存搬运。当前采用经过大规模训练验证的 Triton/BF16 路径。
以 Muon 处理主体矩阵参数,以 AdamW 处理更适合常规更新的参数,并针对海量细粒度专家重新适配了参数组织与跨设备计算,让优化方法稳定扩展至千亿参数。
注:系统层的自研能力是模型层和架构层能够落地的关键,也是 Sand.ai 从众多视频生成创企中脱颖而出的核心壁垒。
Scaling Law 有一个经常被忽略的前提:参数量增大,数据的信息密度也需要同步提高。
但提高信息密度不等于缩小数据集。过度清洗会让模型失去对复杂运动、特殊镜头、罕见主体和非典型声音的覆盖能力,最终参数规模的增长无法转化为真实场景中的生成能力。
Sand.ai 更强调数据的规模、多样性与分布覆盖。数据工作的重点从删减转向组织——通过更准确、细粒度的标注,让模型理解主体、动作、场景、镜头、时序以及音频与文本之间的对应关系。
MAGI-2 Preview 验证了一整条路线:统一单流负责音画联合建模,细粒度 MoE 负责扩大容量,自研系统负责让千亿参数稳定运转。视频生成的 Scaling Law,从此有了新写法。而全面开源,让这条路线成为行业基础设施,而非一家之言。
MAGI-2 Preview 已全面开源,模型权重与推理代码均可获取,开发者可基于此继续探索更长时长、更复杂场景的视频生成。
官方 GitHub 仓库 → 获取模型与代码