整理了下手头几张卡跑DreamBooth的实测感受。跟推理不一样,DreamBooth是消费级AI里最吃显存的活之一,因为它改的是整个模型权重,不像LoRA只动一小部分。
结论上4090的24G基本是舒服区间,SD1.5如果只做这一档,4070 Ti Super的16G上点优化也能凑合跑。显存这块要注意两个变量:开梯度检查点能省一大截,不开的话得多预留三到五成;FP16是前提。
SDXL全量微调比1.5又高一档,加上prior preservation还要再涨。有些卡标着能跑其实是靠模型offload硬撑,训练速度会慢个三五倍,那种严格说只是能跑起来不算能用。
想问下有没有拿16G卡稳定跑完SDXL DreamBooth的,方便说下用了哪些优化吗。