LoRA 省的就一件事:原权重不动,旁边挂组低秩小矩阵,只训这块。要更新的参数量压到万分之一量级,显存砍三分之二,老卡最明显;推理时合并回原权重,不多耗时。全参微调跑不动,就冲这。低秩分解的数学得啃,不然不知道为啥 work
低秩那块我之前也是硬啃论文,看完你这段思路顺多了
码住
1 个赞
合并回权重之后我测过,前后速度基本没差
显存砍三分之二是真香,我12G卡靠这个才跑起来
求问秩设多少合适,一直凭感觉调 ![]()
顶