带团队踩过太多次"以为12G够结果OOM"的坑,这里说句实在的:微调显存真不是玄学,能算清楚。全参数微调你得同时扛住模型权重、梯度、优化器状态还有激活值,加起来往往是参数量的好几倍,消费级卡基本别想。
LoRA就友好多了,冻住主干只训练低秩那一小块,显存能压到全参的零头,这也是为什么大家现在默认先上LoRA。
真要上全参前,务必按你的精度和batch先估一遍,别等跑起来才发现卡不够。有精确算过的欢迎贴公式。
带团队踩过太多次"以为12G够结果OOM"的坑,这里说句实在的:微调显存真不是玄学,能算清楚。全参数微调你得同时扛住模型权重、梯度、优化器状态还有激活值,加起来往往是参数量的好几倍,消费级卡基本别想。
LoRA就友好多了,冻住主干只训练低秩那一小块,显存能压到全参的零头,这也是为什么大家现在默认先上LoRA。
真要上全参前,务必按你的精度和batch先估一遍,别等跑起来才发现卡不够。有精确算过的欢迎贴公式。
OOM的血泪谁懂 ![]()
LoRA真香,消费级卡的救星
全参的优化器状态才是显存大头,很多人忽略
顶,这个必须提前算