Open-Sora 2.0 开源,架构上还是那条路走到底

2.0 放出来了,架构没掉头,还是 3D 自编码器加 Flow Matching 那一套,把 1.2 的思路继续往深里做。变化集中在两处。一是多桶训练,不同时长、不同分辨率的样本能在一次训练里一起喂,数据利用率上去了,也不用为每个分辨率单独开一版;二是注意力换成 3D 全注意力,时空一起算,长程一致性理论上会好不少,代价是算力吃得更狠,序列一长显存曲线相当难看。

对我来说开源这件事本身比那些指标重要,这条技术路线现在总算有一份能读、能改的完整实现摆在这儿。

全注意力质量是好,可长序列显存是平方级涨,中小团队复现成本压不住