微调到底吃多少显存,别再拍脑袋估了

带团队踩过太多次"以为12G够结果OOM"的坑,这里说句实在的:微调显存真不是玄学,能算清楚。全参数微调你得同时扛住模型权重、梯度、优化器状态还有激活值,加起来往往是参数量的好几倍,消费级卡基本别想。

LoRA就友好多了,冻住主干只训练低秩那一小块,显存能压到全参的零头,这也是为什么大家现在默认先上LoRA。

真要上全参前,务必按你的精度和batch先估一遍,别等跑起来才发现卡不够。有精确算过的欢迎贴公式。

OOM的血泪谁懂 :sob:

1 个赞

LoRA真香,消费级卡的救星

全参的优化器状态才是显存大头,很多人忽略

顶,这个必须提前算