Sand.ai 把 MAGI Preview 开源了,视频生成上 MoE 这条路能走通吗

这东西能不能成,我觉得关键不在参数量,在路由稳不稳。

Sand.ai 的 MAGI Preview 开源了,做视频生成,MoE 架构,参数量级到千亿这一档。开源出来的视频模型基本都是稠密模型往上堆规模,把 MoE 摆到台面上做视频生成的,我印象里还真没几个,所以它选的这条路本身就值得单独说一说。

先说为什么盯着路由不放。MoE 省下来的算力是靠稀疏激活换的,每一步只让一小部分专家干活。这套逻辑在文本里跑得顺,是因为 token 和 token 之间相对独立,这个词路由到一组专家、下个词路由到另一组,读起来不太会有割裂感。视频不是这样,它一帧接一帧连着,相邻两帧本来就该长得几乎一样。路由要是在这两帧之间跳到了不同的专家组合上,输出的那点细微差异就会被眼睛当成闪烁,一致性也跟着散掉。所以稀疏激活到底在时序这个维度上怎么切,是我最想看清楚的一块。

Preview 这个后缀其实算它自己给的提示,说明团队心里清楚还没完全成型,现在拿它的效果去下结论都太早。

剩下的等有人真跑起来再说。千亿级听着吓人,但 MoE 真正激活的那部分未必有数字看上去那么恐怖,只是权重全量加载这一关躲不掉,实际显存占用最后落在哪个区间,还得看实测。

蹲一个消费级显卡能不能跑的结论,要是四张卡起步那跟我没关系

前排

MoE 最烦的是推理时候负载不均,一个专家被打爆另外几个闲着,视频这种长序列估计更明显

开源本身就是好事,跑不跑得动是另一回事,至少代码摆在那儿了 :+1:

我更好奇训练数据是从哪来的,视频版权这块国内团队一般都不细说

Preview 版本一般都是先占个位置,正式版才见真章

1 个赞

开源的只有推理代码吗?没训练脚本的话二次微调就难搞