有篇论文把大家训的风格LoRA当成了训练燃料,思路挺妙

有个叫FreeStyle的方法把大家训的风格LoRA当成了训练燃料,这巧思想跟同学们分享下。做AI生图有个老难题:把画面里画了什么和它是什么风格干净地分开,这件事一直很难。原因是你想训模型学这种分离,得有同一内容套很多风格、同一风格套很多内容、还都标注整齐的数据,可现实里的图内容和风格是揉在一起的,这种数据几乎不存在。

数据不够模型就会漏,内容参考图把自己的颜色纹理渗进结果,或者风格参考图把不相干的物体也带进来。

FreeStyle的取巧在于,它盯上了风格信息本来就大量聚集的地方——这几年爱好者和艺术家训练分享出来的海量风格小插件,也就是LoRA,直接拿这堆现成的当干净的训练信号。

它还分两阶段训练,用注意力层和频率感知的手段防止内容或风格互相泄漏。原文在arXiv上,感兴趣的可以去翻。

把社区lora当训练数据这个切入点很聪明

内容和风格解耦确实是老大难

数据不存在所以只能取巧

频率感知那块想看看细节

开源生态反哺研究挺良性的

老师讲得比论文摘要好懂