文生图模型怎么“忘掉”某个概念,这个 AutoAnchor 的思路挺有意思

虽然平时泡这个圈子多是讨论怎么把图画好,但模型“遗忘”这块其实跟大家都相关——版权角色、特定人脸、有害内容,都是靠 unlearning 技术从模型里抹掉的。刚看到一个叫 AutoAnchor 的方法,专门解决 Stable Diffusion 概念擦除不稳定的老问题。

它的观察是:现在要么手动挑一个替代概念当锚点,主观性太强容易擦偏;要么干脆用空提示词,又因为潜空间没约束,擦得不牢。作者从流形假设出发,说缺一个贴近流形的锚点,就会在法向空间产生漂移,把效果搞坏。它的办法是自动合成锚点,再用一个 cross-attention 一致性损失当流形邻近度的廉价替身,省掉直接做几何优化的天价开销。

对咱们的意义在于,擦得干净又不误伤别的画风,才是模型平台敢开放的前提。哪天你发现某个底模死活画不出某个角色,背后多半就是这类东西在起作用。

这块确实容易被忽略,但真上线的模型都得做,不然版权投诉能把你埋了

误伤是最烦的,擦一个概念结果连带把相关画风一起废了

1 个赞

cross-attention 当代理这个巧,直接优化流形谁跑得起 :thinking:

挺有收获

所以有些底模画不出某些东西不是没训,是被主动擦了

空提示词那套我一直觉得不靠谱,果然不稳

误伤这条最头疼,擦一个角色顺带把一类画风也削弱了,精准unlearning比想象难