我手上一张3060 12G,练个角色LoRA一千步得四十多分钟,能出,但rank卡死在16,一开batch就OOM。后来换4070Ti Super 16G,同样的活二十多分钟搞定,rank32随便上,梯度检查点也不用那么抠着用。
差的这4G就是从"跟硬件较劲"到"能安心迭代"的分界线。二手3090也值得看一眼,24G摆那儿,练Flux这种吃显存余量的活比拼纯算力更管用,七百来块比新的16G还香。
8G那套Q4量化加256分辨率的偏方真别碰,出来肉眼可见糊还慢。另外数据集清洗打标的时间往往比训练本身还长,很多人只算显卡账,忘了这块的人力账。