画不对,很多时候是那句话根本没被读懂

出图翻车,你们觉得是画得不行的多,还是压根没读懂你那句话的多?我现在更信后者。

有一类做法是在前面摆一个单独训练好的、很强的文本编码器,先把你那句话嚼透,再交给后面的扩散部分去画。差别我实测很明显:编码器强的时候,复杂点的场景、多个物体的关系、谁在谁前面,它都能对上;弱的时候画面照样好看,但语义经常错位,人多手乱、东西摆错位置。

所以现在写提示词,我不再堆一堆好看的词,先把主体关系讲清楚。

人多手乱太真实了,多主体一直是重灾区 :sob:

我试过同一句话换个模型就对了,跟词写得好不好没关系

1 个赞

同问,那提示词是不是短点反而准