整理一下 FollowFox 那篇从零搭 SDXL 工作流的第二部分,专门测那三个 SDXL 特有的条件参数,信息量挺大。SDXL 训练时把图像尺寸、裁剪坐标、宽高比这些额外信息喂给了模型,推理时我们能反过来用这些参数去指向训练集里某个子集。
几个结论我印象比较深。CLIPTextEncodeSDXL 有 CLIP_G 和 CLIP_L 两个文本输入,他们分别只填一个测,结论是两个一起填最好,单填哪个都掉质量,而且 G 那个 bigG 编码器明显更强势。尺寸条件方面,64/128 出来是糊的,256 开始提,512 到 1024 差别就见仁见智了,2048 和 1024 几乎没区别。裁剪坐标默认 0,0 就对,填 512,0 真会把顶部切掉。宽高比条件影响最小,不太能下死结论。实操层面,正负提示里这些条件值没必要各填一遍,拉成 primitive 输入统一管更干净。