SDXL 的尺寸/裁剪/宽高比条件到底有没有用,搬运一份实测

整理一下 FollowFox 那篇从零搭 SDXL 工作流的第二部分,专门测那三个 SDXL 特有的条件参数,信息量挺大。SDXL 训练时把图像尺寸、裁剪坐标、宽高比这些额外信息喂给了模型,推理时我们能反过来用这些参数去指向训练集里某个子集。

几个结论我印象比较深。CLIPTextEncodeSDXL 有 CLIP_G 和 CLIP_L 两个文本输入,他们分别只填一个测,结论是两个一起填最好,单填哪个都掉质量,而且 G 那个 bigG 编码器明显更强势。尺寸条件方面,64/128 出来是糊的,256 开始提,512 到 1024 差别就见仁见智了,2048 和 1024 几乎没区别。裁剪坐标默认 0,0 就对,填 512,0 真会把顶部切掉。宽高比条件影响最小,不太能下死结论。实操层面,正负提示里这些条件值没必要各填一遍,拉成 primitive 输入统一管更干净。

CLIP_G 更强势这个我一直有感觉,总算有人验证

crop 0,0 是玄学默认值,原来真有作用

2048 和 1024 没区别,那我之前白拉那么高了

尺寸条件指向训练子集这个解释挺到位

两个 CLIP 分开填的人举手,原来一直在坑里

宽高比条件影响小,和我瞎试的感受一致

这系列适合想搞懂 SDXL 内部的,不是无脑抄流