清华校友出手!视频界首个千亿MoE开源,6B激活挤进全球第6

浏览12次 点赞0次 收藏0次

上个月,中国AI,让全球失眠。

先是Kimi K3雷霆出击,正面硬刚Claude Fable 5与GPT-5.6 Sol,成本却断崖式下降约40%。一夜之间,美股蒸发一万亿!

紧接着,DeepSeek-V4-Flash正式版掐点上线。整体性能虽不敌Claude Opus 4.8,但凭借极致性价比,直接斩杀美国一众大模型。


它们背后的MoE架构,早在35年前,就被「AI教父」Hinton和他的合作者提出了。

3年前,全球顶尖AI几乎集体转向这一架构。

但视频生成,始终被挡在门外。

现在,这道门被踢开了。

由清华特奖得主、Marr奖得主曹越领衔的Sand.ai团队,正式发布并开源——MAGI-2 Preview。


Github仓库:https://github.com/SandAI-org/MAGI-2-preview

总参数量高达1140亿,单次前向计算却只激活60亿参数。

这是全球首个开源的千亿级MoE统一音视频生成模型,但价格可以做到主流模型的1/10。

不只是「让图片动起来」

这次的MAGI-2 Preview更大,自然也更智能更强。

先看一段动感十足的中景demo:

阳光下的印度街头,女子身着红白金纹纱丽轻盈旋转,裙摆如花绽放。中景环绕跟拍捕捉流动身姿,舞步、衣摆与环境声精准咬合;从热烈起舞到俯身牵手,眼神与情绪转换自然,感染力十足。

再来看一段人物特写:

窗边冷白柔光下,极近特写缓慢推进,焦点始终锁定女子双眼。她从垂眸、抬眼到轻声开口、浅浅微笑,口型、呼吸与微表情协调。

这角色表演十分细腻。

最后,再看一段电影质感的视频。

雨中街头,低机位掠过水洼涟漪,镜头缓缓移向伞下女子,最终落在车灯映亮的侧脸。雨滴、倒影与环境声细腻同步,冷暖光影交织,克制的眼神变化营造出怀旧而真实的电影氛围。

从高保真音画同步、电影级运镜到细腻的角色表演,MAGI-2 Preview 精准对齐每一次开口、每一个动作与每一段镜头。声音、画面与情绪统一生成,让想象真正成为有节奏、有表演、有感染力的电影画面。


这到底怎么做到的?

114B的容量,6B的账单

过去,视频模型想继续变强,最直接的办法是把Dense模型做得更大。

但Dense有个问题,模型每加一层、每宽一点,每个视频Token都得从更多参数里穿过去一遍。

而视频偏偏是Token密度最高的模态之一。

一张图要拆成大量空间Token,一段视频还要再乘上时间维度;把音频加进来,序列只会更长。

所以视频模型一旦放大,先撞上算力、显存和多机通信的账单。

这就是他们从Dense掉头的直接背景。

曹越在此前采访中透露,团队做完Gaga-1发现,继续放大Dense视频模型,成本涨得越来越凶。


2025年11月,他们决定换条路。

在外界看来,sand.ai每一代模型都在押一个「非共识」。这一次押的是:面对视频生成里效果、速度与成本的三方拉扯,MoE可能是更合理的那条Scaling路径。

MoE会先判断当前Token需要哪些专家,需要谁,才叫醒谁。于是模型容量可以继续增长,单次计算量却不必同步膨胀。

这就是MAGI-2 Preview拥有114B总参数、每次只激活约6B的原因。但它没有止步于此。

一般的MoE,是从一组专家里挑出少数几个,处理当前Token的完整表示。少数专家需要同时处理这个Token的多类特征。


而MAGI-2 Preview则是把3072维表示拆成12个256维子空间,每个head独立从256个专家中选择6个。

因此,一个MoE层共有12×256=3072个head-local专家单元,每个Token实际调用12×6=72个。


Sand.ai把这种结构称为Ultra-fine-grained MoE,也就是超细粒度MoE。

这种设计的意义,是把「选哪个专家」变成一个更细的组合问题。

同一个视频Token,在不同表示维度上可以走完全不同的处理路径。模型不必在「调用一个大专家」和「不调用」之间做单选,而是能拼出更丰富的能力组合。

但专家拆得越细,下一个问题就越棘手——通信。

千亿级MoE到底怎么跑起来?

传统专家并行采用「先路由、再通信」。

模型先决定每个Token该去哪些专家,再把Token复制到专家所在的GPU。Top-k越大,跨卡搬运的数据越多;路由结果又随输入变化,通信量很难保持稳定。

视频序列本来就比文本长得多,MAGI-2 Preview又把路由细化到12个head、每个head选择6个专家。照传统方式继续扩张,瓶颈很快会从计算转移到网络。

Sand.ai设计的Head Parallel把顺序倒了过来:先通信,再路由。


在路由发生之前,模型就按头把固定形状的表示分发到各个设备。每个设备拿到自己负责的那个头之后,在本地完成路由和专家计算。

跨设备传输的数据量因此变得固定,不再随着Top-k激活专家数线性增长,也不会因为输入不同而剧烈波动。

Head Parallel把跨卡通信移到了路由之前。每个Token只需传输一次固定形状的head表示,通信量不再随着Top-k激活专家数线性增长,也不会因为路由结果变化而剧烈波动。

这解释了MAGI-2 Preview为什么敢把专家颗粒度继续拆细:专家可以更多、分工可以更细,但通信开销不必跟着同步膨胀。

围绕Head Parallel,Sand.ai还有两张牌。

  • MagiMoE,高性能MoE算子库,覆盖路由、专家排序和专家计算的完整链路,把原本分散的步骤合并执行,减少中间buffer和显存搬运。当前采用的是经过大规模训练验证的Triton/BF16路径。

  • MagiMuon,自研分布式优化器,用Muon处理主体矩阵参数,用AdamW处理更适合常规更新的参数,并针对数千个细粒度专家重新适配了参数组织和跨设备计算,让训练能从中小规模实验平稳扩展到千亿参数。

三者的分工很清楚:模型结构决定调用哪些专家,Head Parallel和MagiMoE负责通信与计算,MagiMuon负责大规模参数更新。

MAGI-2 Preview开源的因此不只是一个114B checkpoint,而是一条把模型、通信、算子和优化器共同推到千亿规模的系统路线。

细粒度MoE最怕的,是名义上拥有几千个专家,最后大家学得却差不多——真正决定专家分工的,不是数量,而是数据。

MAGI-2 Preview的数据管线从简单过滤转向广覆盖与细粒度标注,让不同类型的视频信息都能变成路由器可以学习的信号。

基础模型在预训练阶段覆盖得越完整,后训练就越不需要忙着修补运动、细节和组合能力,而能更多用于偏好对齐与产品适配。

3072个专家单元提供的是容量,数据决定这些容量能不能变成真正不同的能力。

到这里,模型容量、计算系统和数据管线才算真正接上。

画面和声音,是一起长出来的

省钱之外,MAGI-2 Preview还干了另一件事:统一音视频生成。

行业里不少「音画同步」方案,实际是两套模型串起来跑,先出视频,再配声音,后期缝在一起。声画两张皮,硬粘。

MAGI-2 Preview把文本、视频和音频放进同一个上下文,在每一层self-attention中直接交换信息;共享专家学习三种模态的共性,模态专属专家处理各自的差异。


口型、动作重音、表情和镜头节奏,从生成第一步就在被共同建模,而不是先出画面、再把声音缝上去。

这套单流音视频架构此前已在daVinci-MagiHuman中采用,MAGI-2 Preview又把它扩展到了千亿参数规模。

效果就是,口型跟台词对得上,动作重音和声音踩在同一拍,镜头切换时环境声跟着变。全程模型自己算出来的,没有后期拼接。

榜单和账单,一起算

聊了这么多架构,最终还是要回答两件事:有多强,有多贵。

能力上,MAGI-2 Preview在Artificial Analysis图生视频(含音频)榜单中拿下第六,Elo得分1106。

也就是说,一个只激活约6B参数的开源模型,挤进了一群几十上百B激活参数的闭源模型中间。


按8卡H100的月租金折算,蒸馏模型生成10秒视频约0.5元,约为行业主流模型的十分之一。

从几块钱降到几毛钱,对视频产品团队来说,已经是另一门生意。


35年前,MoE还只是Hinton等人论文中的一种设想。

35年后,它变成了一个拥有114B参数、每次只激活约6B,并且完全开源的视频生成模型。

语言模型走过的路,终于轮到了视频。

编辑:摩西 大卫

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯