不重训模型,直接在潜空间里把一张脸改细

做人像个性化最烦的从来不是改不动,而是一改就不像本人了。眉毛压低两分,出来的人整个换了个身份,这种事我遇到过太多次。最近看到的 Latent-Identity Tuning 思路挺对我胃口:不动模型、不加训练,冻结的编码器原样用,只是把身份在潜空间里的表示拆开看。它把这块潜空间当成一组 latent token,每个 token 各自管着身份的不同侧面,有些甚至能对上具体的空间或语义区域。找到有意义的语义方向,再限定在某几个 token 撑起的子空间里去挪,改动就能局部化,改鼻子不牵连眼睛。

对我来说最实际的一点是省事:不用为每个新身份、每个新编辑任务再跑一轮微调,把它当成生成前的一步潜空间操作插进去就行。而且因为改的是身份表示本身而不是出图后再 P,多张图之间的一致性是天然的,这比图像级编辑靠谱。

问一句,token 和面部区域的对应是靠人工标出来的还是自动找的

1 个赞

不用重训这条就够香了,微调一次的卡时成本谁用谁知道 :sob:

mark

感觉后面头像、虚拟形象那类产品会先吃到这个红利

局部编辑听着美好,实际用起来大概率还是有耦合,眉毛动了眼窝跟着变那种

耦合这点我也担心,眉毛一动眼窝跟着变,局部编辑很难真做到局部。