很多人觉得 SD1.5 已经到头了,我倒不这么看,1.5 底子上能榨的东西还多着呢。最近照着 FollowFox 那套 Cosmopolitan 的思路走了一遍全流程,记录一下。
数据集用的 Midjourney 生成的合成图,从七点几个 G 的原始表里挑子集,最后留了一万一千多对图文,划了 15% 出来做验证集。训练器还是 EveryDream2,这次特意加了 768 分辨率一起练,不只是 512。
768 那个 run 在 Runpod 上老是随机断,重试好几次浪费大把时间,最后 512 用 D-Adaptation,768 换回老实的 AdamW。停的判据是验证 loss 开始持续往上抬,512 大概 70 epoch,768 是 60。
后面就是混模,vodka 底之间互混,再掺第三方模型。realistic vision、dreamshaper 这些老面孔按 60/20/20 配。最后选出来的是那个 768 混合版,比老的 BloodyMary 灵活。有兴趣的 Civitai 上能下。