折腾LoRA之前,先把它到底省在哪搞明白

LoRA 省的就一件事:原权重不动,旁边挂组低秩小矩阵,只训这块。要更新的参数量压到万分之一量级,显存砍三分之二,老卡最明显;推理时合并回原权重,不多耗时。全参微调跑不动,就冲这。低秩分解的数学得啃,不然不知道为啥 work

低秩那块我之前也是硬啃论文,看完你这段思路顺多了

码住

1 个赞

合并回权重之后我测过,前后速度基本没差

显存砍三分之二是真香,我12G卡靠这个才跑起来

求问秩设多少合适,一直凭感觉调 :thinking: