把动漫底模改成MoE了,双2B分噪声段这思路有点意思

这套duplex anima的做法值得盯一下:把动漫底模往MoE架构上迁,两个2B的小模型,各自负责一段降噪区间去训。作者说自然语言prompt吃得挺好,但出来的风格总差点意思,他自己也在琢磨怎么修——怀疑是最近把最大prompt长度从512拉到2048带偏了。

硬件就俩T4、32G显存,实时的训练checkpoint分高噪、低噪两个放着。

方法论是从DiffusionBlocks那套block-wise训练借来的。小卡能跑MoE分段训练这条线,我觉得比一味堆参数有搞头,就是风格塌这个问题不好解。

两张T4能跑MoE分段训练,这个成本控制是真香。

512拉到2048就风格塌,会不会是长context下降噪分段的边界没对齐?

顶一个 :+1:

两个2B分噪声段这思路挺聪明,就是推理时来回切模型会不会多一次加载开销