角色LoRA我一直嫌普通SFT收敛慢,还不一定练得像。有人干脆把人脸相似度这条链路当可微目标来优化,思路挺顺——反正整个人脸embedding的距离本来就能求导,那就别去学预测噪声或者速度了,直接拿脸的相似度当loss来训。
4090上十来分钟就能出一版,据说对各种数据集都挺稳。代价是单步慢不少:普通SFT大概0.5秒一步,这种方案一步要四秒多,因为中间要生图、VAE解码、人脸检测再反传,一整套全算进去了。
总步数少、每步更贵,换来的是目标对齐更强,这买卖在角色向上我觉得划算。有实测过的说说过拟合是怎么压住的?