把人脸相似度直接当训练目标,角色LoRA收敛比普通SFT快太多

角色LoRA我一直嫌普通SFT收敛慢,还不一定练得像。有人干脆把人脸相似度这条链路当可微目标来优化,思路挺顺——反正整个人脸embedding的距离本来就能求导,那就别去学预测噪声或者速度了,直接拿脸的相似度当loss来训。

4090上十来分钟就能出一版,据说对各种数据集都挺稳。代价是单步慢不少:普通SFT大概0.5秒一步,这种方案一步要四秒多,因为中间要生图、VAE解码、人脸检测再反传,一整套全算进去了。

总步数少、每步更贵,换来的是目标对齐更强,这买卖在角色向上我觉得划算。有实测过的说说过拟合是怎么压住的?

可微pipeline直接当目标训,这个切入角度挺妙

4090十分钟真香 :fire:

蹲实测