做人像个性化最烦的从来不是改不动,而是一改就不像本人了。眉毛压低两分,出来的人整个换了个身份,这种事我遇到过太多次。最近看到的 Latent-Identity Tuning 思路挺对我胃口:不动模型、不加训练,冻结的编码器原样用,只是把身份在潜空间里的表示拆开看。它把这块潜空间当成一组 latent token,每个 token 各自管着身份的不同侧面,有些甚至能对上具体的空间或语义区域。找到有意义的语义方向,再限定在某几个 token 撑起的子空间里去挪,改动就能局部化,改鼻子不牵连眼睛。
对我来说最实际的一点是省事:不用为每个新身份、每个新编辑任务再跑一轮微调,把它当成生成前的一步潜空间操作插进去就行。而且因为改的是身份表示本身而不是出图后再 P,多张图之间的一致性是天然的,这比图像级编辑靠谱。