
分析师/竹心
2026年8月5日,视频生成行业迎来了一场“震撼发布”。
Sand.ai 正式发布并开源 MAGI-2 Preview ——全球首个千亿级开源 MoE 视频生成模型,总参数约 114B,单次前向计算仅激活约 6B 参数。凭借约 6B 激活参数,MAGI-2 Preview 进入 Artificial Analysis 视频生成榜单前六。

模型权重和代码同步上线,无需申请、无需排队,任何一个研究者、开发者或企业技术团队,都可以直接下载、部署、微调。
过去两年,视频生成最强能力被封装进 API,按 token 收费、按帧计费。开源社区几乎拿不到可用的大尺寸视频模型,看不到权重、无法复现训练、很难根据自己的数据继续改造。
当一个千亿级、统一音视频的模型以开放权重和代码的方式进入公共领域,这种不对称正在被打破。除了为开源社区增添了一款前沿模型,MAGI-2 Preview 还改变了一件事:视频生成模型扩展的技术路线选择。
在模型能力和尺寸正相关已是行业共识的背景下,此前视频生成模型 Scaling 的路径似乎只有一条,堆算力、堆数据,花更多的钱,把模型参数量扩大。
过去两年,视频生成是AI领域最热闹的赛道之一。
OpenAI Sora、Google Veo、Runway Gen、Pika、可灵、seedance……每隔几个月就有一个视频生成模型刷屏,这项能力从实验室走向生产流程,只用了不到两年。
但热闹之下,有一群人始终没有获得入场券。
开发者可以看到生成结果,却看不到权重;研究者可以阅读技术报告,却无法复现训练过程;企业可以调用 API 生成视频,却很难根据自己的数据对模型进行微调和改造。
与此同时,LLM 领域正上演着完全不同的剧本。LLaMA 开源后,整个产业被彻底激活——研究、微调、私有化部署、工具链全面跟进,GLM5.2、Kimi K3、DeepSeek 等开源模型已经成为学术研究和产业应用的基础设施。
直到最近,这种不对称才出现松动。MiniMax H3 位列AA榜单第三并开放权重。一天之后,MAGI-2 Preview 又以千亿级 MoE 的形态直接开源,模型权重和代码同步上线。开源生态第一次真正进入了视频生成的前沿竞争。
备注:Sand.ai 新模型所生成的日式老电影风格视频
同样是开源,为什么 MAGI-2 Preview 值得被重点关注?当模型进入百亿、千亿参数区间,训练和推理成本的急剧上升已经成为所有参与者必须面对的现实问题。MoE 正在打开另一条路——模型可以继续做大,但单次推理成本被控制在可用范围内。
MAGI-2 Preview 不仅仅是一个更大的模型,更是一条完全不同的技术路线。要理解这条新路线,先要理解旧路线遇到了什么问题。
过去几年,视频生成大模型遵循着一条朴素的 Scaling 逻辑:模型越大,能力越强。和大语言模型早期的稠密模型一样,其扩展的方法是增加层数、加宽隐藏维度、堆更多参数。
但视频模型面临的挑战更残酷。一段视频被拆成空间 patch 和连续帧,再叠加音频与文本,序列长度轻松达到数万甚至数十万 token。稠密模型下,每一个 token 都要经过全部参数,计算量随序列长度和参数规模同步膨胀。
视频模型做一次前向计算,文本模型可以跑几十次。换句话说,稠密模型扩展的成本,在视频领域被急剧放大了。
MoE 换了一种思路。它不再让每个 token 都经过全部参数,而是在模型内部设置了一个庞大的专家池,每个 token 只调用与当前任务相关的一小部分专家。总参数规模决定了模型的“知识容量”,激活参数决定了单次推理的“计算成本”。
MAGI-2 Preview 正是沿着这条思路设计的——114B 的总参数形成了足够大的知识容器,每次前向计算只激活约 6B 参数,把实际计算控制在一个可执行的范围内。更大的参数池用于学习更丰富的人物、动作、镜头语言、材质细节,以及语义、语音和环境声等多模态信息。
备注:Sand.ai 新模型所生成的人物表演舞蹈视频
能力和成本只是结果。MoE 真正的设计难点,在于这 114B 参数如何被组织——谁来决定哪个专家处理什么任务,如何让数千个专家形成有效的分工。
传统 MoE 的做法是“一个 token 选一组专家”,每个专家需要同时理解语义、动作、声音等多种特征——这是一种“通才型”分工,每种能力的精度都可能被稀释。
MAGI-2 Preview 的思路相反:把任务拆细。它将隐藏表示分成12 个独立的“头”,每个头独立选择自己的专家,不同头可以分别专注人物、动作、声音、语义等不同任务,最后再融合在一起。作为参照,DeepSeek-V4-Pro 每层 384 个专家选 6,Kimi K3 为 896 选 16,而 MAGI-2 Preview 每层形成 3,072 个专家单元。这种“通才拆成专才”的结构,恰恰是稠密模型做不到的。
千亿 MoE 不是简单的增加参数
和专家,系统能力才是真正的门槛
MAGI-2 Preview 为视频生成开辟了一条新的 Scaling 路径,但把这条路径走通,靠的不只是架构设计。
在大模型竞赛中,模型参数规模是可见的冰山,底下的系统能力才是真正的水下部分。因为把数千个细粒度专家在多台机器间高效路由、稳定训练,需要极高的系统工程门槛。
在传统的 Expert Parallel 模式下,系统会先为 token 选择 Top-K 专家,再把 token 发送到专家所在的设备。路由结果随输入动态变化——某块 GPU 可能突然收到大量 token,另一块 GPU 却没有足够任务;激活的专家越多,设备间需要传输的数据也越多。到了视频的序列规模,通信和负载波动很快会成为瓶颈。
模型的专家再多,如果数据传输和任务调度把大部分时间消耗在等待上,算力的规模优势也会被抵消。
为了解决这一问题,Sand.ai 做了三件事。
第一件事是 Head Parallel。它改变了通信顺序——在路由发生前就按 head 分配计算,将固定形状的表示分发到不同设备,数据抵达后再在本地选择专家。传统方式的通信量依赖路由结果,而 Head Parallel 的通信量由输入本身决定,不再随激活专家数线性增长。跨设备流量因此变得稳定、可预测。
第二件事是 MagiMoE kernel 库。Ultra-fine-grained MoE 带来了大量小矩阵计算和频繁的显存读写。MagiMoE 把原本分散的路由、排序和计算步骤融合执行,减少中间结果和显存搬运,并针对 Multi-Head MoE 的计算形态优化前向与反向过程。
第三件事是 MagiMuon 优化器。千亿参数 MoE 的训练涉及性质完全不同的参数——主体矩阵参数、专家参数、路由参数——它们对更新方式的需求各不相同。MagiMuon 在 Muon 的基础上做了扩展,保留其处理主体矩阵参数的优势,同时引入 AdamW 处理更适合常规更新的参数,让训练在千亿规模下保持稳定。
系统跑通后,Scaling 只完成了一半。另一半在数据。
过去行业普遍将“数据质量”等同于层层过滤——删除画质较差、构图不够整齐、动作不够典型的数据,留下一个更干净的数据集。从训练稳定性角度看,这确实能降低噪声、提升收敛效率。但真实世界的多样性,往往恰恰藏在那些“不够标准”的数据里——复杂运动、特殊镜头、罕见主体、非常规声音、长尾组合。如果模型只在整齐的数据上训练,它学到的世界就是一个被剪裁过的世界。
因此,MAGI-2 Preview 的数据策略更强调数据规模、多样性与分布覆盖,工作的重心从“删减”转向“组织”——通过更准确、更细粒度的标注,让模型理解主体、动作、场景、时序以及音频与文本之间的对应关系。
模型设计、系统能力、数据处理——三者构成了 Sand.ai 在 Scaling 这条路上的完整判断。MAGI-2 Preview 的价值,正在于它让这三件事在同一次规模化训练中同时得到了验证。
10 秒 1080P 仅 0.5 元,
MoE 的成本优势意味着什么
验证之后呢?最直接的变化,落在成本上。
按照当前 8 卡 H100 的月租金折算,MAGI-2 Preview(蒸馏后模型)生成一段 10 秒 1080P 视频的推理成本约 0.5 元。每秒成本约为行业主流模型的十分之一。
0.5 元和 5 元之间,看起来只是一个小数点的差别。但放到真实创作场景里,它改变的是成本结构和内容生产方式。
在实际制作中,一条生成视频很少一次就完全符合预期。成本足够低之后,创作者可以测试不同的提示词,调整动作、构图和风格,再从多个版本中筛选真正可用的镜头。一个想法可以反复试验,逐步收敛。
视频生成从“昂贵的一次性押注”转向“多版本生成、自动筛选、人工选择”的迭代模式。这不是效率的提升,这是工作方式的改变。
内容工具、广告系统、游戏资产生成、虚拟人互动,这些需要持续调用模型的场景,过去被成本卡住了门槛,现在 0.5 元打开了那扇门。
这就是 MoE 这条 Scaling 路线区别于稠密模型的核心价值。“用得起”三个字,是所有产业化的起点。只有当成本降到用户可以“随手用、反复试、持续跑”的程度,技术才算真正进入了生产环节。
结尾:非共识选择的再次验证
MAGI-2 Preview 不是 Sand.ai 的第一个开源模型,也不会是最后一个。
回顾这家公司过去三年的技术路线,会发现一个清晰的 Pattern:它总是在选择非共识路线,然后把它跑通。
2024 年,视频生成领域最主流的技术路线是扩散模型(Diffusion)。Sand.ai 的第一代视频生成模型 Magi-1 选择了自回归路线。最终,Magi-1 跑通了,而自回归路线已经成为了当下行业的主流选择。
2025 年,行业的主流做法是“多流拼接”,但 Sand.ai 提出了统一单流架构,用GAGA-1 证明了统一架构在音画同步上的优势。

2026 年,行业的主流是稠密模型,Sand.ai 再次选择了一条非共识路线—MoE,在 MAGI-2 Preview 出现之前,这条路能不能走通,没有人知道。
三次选择,三次非共识,每一次都跑成了可以被外界检验的模型。
这不是运气。这是技术判断力,一种在技术路线尚未收敛时,识别出哪条路有长期价值的能力。
MAGI-2 Preview 不是终点。MoE 路线从非共识变成行业新变量之后,视频生成正在进入一个新的阶段——不是“谁家模型更强”的静态比较,而是“谁能用新路线做出更好的产品、更低的成本、更完整的工具链”的动态竞争。

