总有人问训LoRA买什么卡,其实得看你训什么。SDXL和Flux.1的LoRA微调、做角色一致性的DreamBooth、整模型全量微调,吃硬件完全不是一个量级。就LoRA而言16G显存算个甜点位。4090是消费级里最快的,1500步的Flux.
1 LoRA大概二十到三十分钟跑完,迭代很爽。预算紧就4060Ti 16G,胜在显存留得宽。3060 12G能训轻量的,但很快就捉襟见肘。Flux本身特别吃内存,8G那种得开激进的梯度检查点才勉强,batch一大就爆。
4070Ti Super 16G训Flux紧巴巴,开检查点能跑,就是比24G慢五成到八成。全量微调消费卡基本别想,那是另一个世界的事。