图片模型的量化跟大语言模型不太一样。语言模型你压的是文字预测权重,差一个token在文本里看不出来;但图像压的是UNet或者DiT,还有文本编码器,画质损失是直接反映在像素上的,差一点点人眼立刻就能捕捉到。
我的经验是FP16还是默认首选,质量最好,8G以上就能舒服放下。FP8能把UNet显存砍一半,画质损失在40、50系这种原生支持FP8的卡上几乎看不出来,12到16G的卡它是甜点位。
NF4也就是4比特,是低显存卡的最后手段,能跑,但复杂提示词下画质掉得挺明显。这些数字都是1024分辨率单batch下测的,实际会随实现和分辨率浮动。别盲目追低精度省显存,画质是要还回去的。