文生图模型的原理,其实值得每个天天用的人搞明白一次

天天在调提示词,但真正把文本生成图像那套机制捋清楚的人不多。说白了就是模型学会了把文字描述映射到图像的高维空间,再从噪声一步步还原成图。理解了这层,很多玄学问题就不玄了——为什么某些词权重能左右画面、为什么负面提示词有用、为什么同样的词换个顺序结果就变。

我一直觉得把底层原理过一遍,比背一百个所谓万能咒有用得多,起码你知道自己在跟什么打交道,调参也从蒙变成推。

谁再问我提示词玄学,我都劝先看看模型到底怎么工作的。

认同,懂了扩散过程再看负面提示词就一点不神秘了

从蒙变成推这句到位,原理这关早晚得过

收藏了慢慢啃

1 个赞

调了这么久提示词才回头看原理,负面提示词为啥有用一下就通了,早该过这关