有个叫FreeStyle的方法把大家训的风格LoRA当成了训练燃料,这巧思想跟同学们分享下。做AI生图有个老难题:把画面里画了什么和它是什么风格干净地分开,这件事一直很难。原因是你想训模型学这种分离,得有同一内容套很多风格、同一风格套很多内容、还都标注整齐的数据,可现实里的图内容和风格是揉在一起的,这种数据几乎不存在。
数据不够模型就会漏,内容参考图把自己的颜色纹理渗进结果,或者风格参考图把不相干的物体也带进来。
FreeStyle的取巧在于,它盯上了风格信息本来就大量聚集的地方——这几年爱好者和艺术家训练分享出来的海量风格小插件,也就是LoRA,直接拿这堆现成的当干净的训练信号。
它还分两阶段训练,用注意力层和频率感知的手段防止内容或风格互相泄漏。原文在arXiv上,感兴趣的可以去翻。