2026做DreamBooth训练,显存才是硬门槛

整理了下手头几张卡跑DreamBooth的实测感受。跟推理不一样,DreamBooth是消费级AI里最吃显存的活之一,因为它改的是整个模型权重,不像LoRA只动一小部分。

结论上4090的24G基本是舒服区间,SD1.5如果只做这一档,4070 Ti Super的16G上点优化也能凑合跑。显存这块要注意两个变量:开梯度检查点能省一大截,不开的话得多预留三到五成;FP16是前提。

SDXL全量微调比1.5又高一档,加上prior preservation还要再涨。有些卡标着能跑其实是靠模型offload硬撑,训练速度会慢个三五倍,那种严格说只是能跑起来不算能用。

想问下有没有拿16G卡稳定跑完SDXL DreamBooth的,方便说下用了哪些优化吗。

16G跑SDXL全量基本靠offload硬撑,慢到怀疑人生

梯度检查点是真省显存,必开

4090这个价位确实是甜点,再往上不划算

现在很多人转LoRA就是被DreamBooth显存劝退的

offload能跑不等于能用,这句话说到点上了