Midjourney出图那么真,底层其实是两套东西拼起来的

为什么一句话丢进去,出来的图能差点骗过专业摄影师?扒了下大概原理才发现,它其实是两套机器学习的东西缝在一块:一套负责读你写的那句文字、把语义拆开,另一套负责把拆出来的语义一步步“扩散”成像素。

一个管理解,一个管画。理解那步越准,画面就越贴你想要的——同一句提示,词序和用词稍微动一下,出来的东西能差挺远,问题多半出在前半段。

想通这层,写提示词就没那么玄学了,起码知道自己在跟哪一部分较劲。

怪不得我把形容词挪个位置,出来就换了个人

谢bro

那负责画的那半是不是纯执行,自己不带判断的?

1 个赞